9月16日,“面向Agent时代的AI Infra技术趋势Workshop”于上海举办。本次Workshop作为华为全联接大会2026“Day 0”系列活动之一,以“共筑生态 聚智全球”为主题,旨在凝聚共识,寻找Agent时代AI Infra产业出海同心同路人,通过梳理Agent/MaaS生态伙伴、定义AI Infra 2.0标准架构,为未来中东、中亚AIDC技术白皮书及WAICO技术路线奠定基础。江苏润和软件(300339)股份有限公司(以下简称“润和软件(300339)”)受邀参会,围绕大规模智算集群全链路运维与算力资产增效开展主题分享,介绍面向万卡级场景的智算集群与异构算力治理技术思路,同时围绕国产AI基础设施出海展开行业探讨。
研讨会上,润和软件(300339)智算事业部解决方案总监巩远波发表《润和软件(300339)Token工厂:AI Infra全链路智能运维的探索与实践》主题演讲。他指出,大规模集群运维的核心难点不在于单点设备监控,而在于芯片驱动、容器运行时、网络总线、硬件带外管理、能效控制、负载编排、训练自愈七层对象的全链路协同,任何一层出现割裂,都可能造成集群整体Token产出下降。
当前万卡级智算场景快速演进,行业发展同时面临六大现实痛点:
故障常态化:集群规模越大硬件故障概率越高,直接侵蚀有效训练时长
五维异构难题:多品牌算力硬件混跑,带来算力混池效率损耗
网络瓶颈:大规模集群中网络建设成本高,同时容易成为业务性能短板
推理性能墙:MoE等模型场景下推理吞吐存在明显差距
训推冲突:训练、推理任务争抢算力资源,小作业资源利用率偏低
电力空耗问题:即便业务负载不高,硬件依旧维持峰值功耗,推高智算中心运营成本
针对上述行业痛点,润和软件(300339)基于openEuler开源底座,打造Token工厂AI Infra全链路智能运维技术方案,分层破解大规模智算集群的各类挑战。
异构基础层,化解算力“碎片化税”
依托超节点操作系统基座与iSulad统一容器运行时,屏蔽多厂商软硬件异构差异,完成驱动、固件、AI框架的统一基线治理;基于KubeOS实现操作系统的云原生生命周期(883436)编排,支持节点OS在线升级、镜像重装、故障回滚,夯实万卡智算集群稳定运行底座。
统一高速网络层,释放集群通信效能
完成灵衢总线适配优化,结合AI场景RoCE拥塞控制、DPU卸载能力,实现多厂商网络设备统一纳管,提升集群通信效率,降低网络综合投入。
硬件监控遥测层,实现故障自动闭环处置
采用带外监控方案,近乎零业务开销采集硬件健康指标,实现秒级故障识别;联动调度组件完成任务自动迁移与训练续训,减少硬件故障带来的算力损失。
能效管理层,打造负载自适应的智算中心
搭建“预测-执行-反馈-修正”的能效闭环,根据训推业务潮汐特征动态调节功耗;结合电价、绿电、碳排放约束调度可延迟任务,在保障业务SLA前提下降低算力运营成本。
负载自动化编排层,实现异构算力统一池化调度
打造AI原生调度器,支持拓扑感知调度、训推混部、多约束资源放置、故障自愈,实现各类异构算力统一调度管理,提升整体资源利用效率。
未来,润和软件(300339)将持续依托openEuler开源生态,迭代完善Token工厂AI Infra全链路智能运维相关技术,持续探索Agent时代 AI Infra 建设新思路,携手产业伙伴共同推进智算产业创新发展。
