近日,百度百舸基于通用GPU集群完成Cosmos3-Super64B世界模型512卡训练验证,在无需NVLink、无HPN网络的环境下,实现从32卡扩展至512卡97.48%的集群扩展效率,验证了AIInfra工程优化能够有效支撑大规模世界模型训练。此次实践进一步证明,大模型训练效率不仅取决于硬件规模,更依赖训练框架、通信网络与基础设施之间的系统协同,为世界模型训练提供了新的工程实践路径。
测试过程中,集群规模从4节点32卡逐步扩展至64节点512卡。结果显示,训练吞吐由33.997samples/s提升至530.227samples/s,整体扩展效率达到97.48%,Loss曲线与小规模训练保持一致,实现训练性能与模型收敛效果同步稳定。

这一结果意味着,在无需NVLink和HPN等专用高性能互联条件下,通过训练框架、通信网络及AIInfra工程优化协同,通用GPU集群同样能够实现大规模世界模型的稳定训练,为更多企业开展大模型研发提供了可复制的工程实践。
随着世界模型不断扩大,训练过程中面临显存管理、通信效率、并行策略以及系统稳定性等多重挑战,仅依赖硬件升级已难以持续提升整体训练效率。针对这些挑战,百度百舸围绕训练框架、通信网络及资源调度进行了系统性AIInfra工程优化,通过FSDP2全量分片、ERI高速网络协同、编译优化及显存管理优化等能力,实现训练效率与集群扩展能力同步提升,并有效保障大规模训练过程中的稳定性。
实践表明,AIInfra工程优化正成为释放算力价值、提升大模型训练效率的重要能力,也成为世界模型持续扩展的重要基础。
近年来,世界模型正加速向机器人、自动驾驶等具身智能场景拓展,对AI基础设施提出更高要求。如何在控制成本的同时,实现更高训练效率和更大集群规模,成为产业关注的重要方向。
百度百舸持续围绕AIInfra能力建设,打造覆盖数据准备、模型训练、推理部署等全流程AI计算平台,目前已服务众多AI创新企业及科研机构,支撑世界模型、视觉语言模型(VLM)、视觉语言动作模型(VLA)等多类基础模型训练。
未来,百度智能云将持续完善AIInfra工程优化能力,不断提升训练效率、集群扩展能力和系统稳定性,为更多基础模型创新提供高效、稳定、可扩展的AI计算底座。