具身智能的研发,算力需求并不是固定的。当通用具身智能机器人公司深朴智能旗下机器人小朴Simbot进入北京丽都维景酒店开展POC场景验证时,算力问题早已不只是一个机器人模型如何训练的问题。

在实验室里,一项实验可能只需要少量GPU,进入正式训练后资源规模迅速扩大;训练结束,算力需求又随之回落。进入强化学习(RL)后训练,计算负载进一步变化;模型走出云端、进入真实机器人,还要经过边缘推理和端侧执行,现场产生的数据又会返回云端,进入下一轮模型迭代。
这种高度波动的负载,意味着深朴智能需要的不是按照峰值长期持有的固定服务器,而是一套能够随着研发任务变化而伸缩的算力基础设施——最终,深朴智能选择将其核心模型研发与训练任务部署在九章智算云上。
此前整租算力服务器时,峰值需求与日常使用之间存在明显落差。采用九章智算云VKS弹性容器集群后,GPU被纳入统一资源池,深朴智能可以按任务申请和释放资源,秒级即可完成从8卡到256卡的弹性算力扩展,按照实际使用量计费,综合成本下降82.1%。
“具身智能的算力需求高度潮汐,弹性缩放对降本至关重要。当前算力与通信约占整机成本8%,随着模型规模和机器人部署增加,这部分成本还会持续累积。九章智算云不仅解决了即时动态扩缩算力供给问题,还通过统一调度和训推效率优化,从基础设施层面降低整体成本。”联合技术小组专家表示。
弹性调度:让资源跟着模型研发变化
这种“潮汐式”算力需求,与深朴智能的算法研发节奏直接相关。
其HiFi-UMI技术研究尝试降低具身模型后训练对真实机器人遥操作数据的依赖,通过高保真的人类第一视角数据完成后训练,再部署到真实机器人验证;EgoRecovery则关注机器人执行失败后的恢复,通过人类视角数据和强化学习,让模型学习更加稳定的恢复策略。
从算法实验到正式训练,再到强化学习(RL)后训练,不同阶段对应着不同资源需求。尤其进入后训练阶段后,计算任务不再是一次性作业,而是需要持续运行和反复迭代。
九章智算云VKS弹性容器集群将GPU纳入统一资源池,训练任务可以根据负载获得所需资源,结束后释放,使不同规模的实验能够共享同一资源池,算力资源可以围绕实际任务动态分配。
九章智算云采用Serverless+RL基础架构,让弹性资源调度适配强化学习(RL)后训练的动态负载。深朴智能依托九章智算云专属算力计量体系“1度算力”(1 DCU = 312 TFLOPS × 1小时)计费,使算力成本进一步与实际任务使用量对应。
对于深朴智能来说,这解决的并不只是“有没有GPU”,而是GPU能否跟上算法研发的真实节奏,又能在任务结束后及时释放,九章智算云让算力资源与模型研发的真实使用曲线真正匹配起来。
数据、存储与缓存:GPU扩上去了,数据也要跟得上
当计算资源可以快速扩展,另一个问题随之出现:数据是否能够及时供给?
具身智能训练涉及大量视频、图像和机器人轨迹数据。数据规模扩大后,磁盘空间和读写速度都可能成为训练瓶颈。九章智算云支持开源具身智能模型缓存,结合数据缓存减少磁盘空间占用,同时通过高性能存储提升视频等数据的读写效率,减少数据读取对训练任务的影响。
模型进入运行阶段后,数据问题又变成了状态和上下文的复用。
机器人面对连续环境时,视觉、语言、动作等信息不断累积。KV Cache可以复用已经计算过的上下文,减少重复计算。九章智算云将KV Cache与计算资源、数据路径放在一起处理,依托DingoFS分布式文件系统、DFKV高性能KVCache缓存、全域零拷贝链路、RDMA高速网络等底层技术,减少模型权重、缓存及中间状态在不同计算节点之间不必要的数据搬运。
由此,存储和缓存不再只是附属能力,而是与GPU计算共同构成数据链路体系:高性能存储负责训练数据,模型缓存减少重复存储,KV Cache服务运行时状态复用,数据链路降低计算过程中的搬运开销。
对于需要处理长序列、多模态数据和连续交互的具身模型而言,这些环节共同决定了GPU获得的算力能否真正转化成训练和推理效率。
RL训推与云边端:让模型真正进入机器人
对深朴智能而言,模型训练完成只是下一阶段的开始。HiFi-UMI等研究需要经过后训练,再进入真实机器人验证,算法和基础设施也因此需要同步迭代。
在这一过程中,双方形成了算法和基础设施同步迭代的协作模式。“我们提出模型RL算法,九章智算云则能快速迭代RL基础设施技术栈,双方形成算法与工程系统双向RL Scaling的协作模式,对HiFi-UMI技术成熟至关重要。”联合技术小组专家表示。
为了缩短从实验到训练的路径,深朴智能使用九章智算云ALab、CCI云容器实例、极核训练等工具,覆盖实验开发、容器化运行和训练任务。
当模型完成云端训练和后训练,计算链路进一步延伸到机器人侧,形成云训练—边推理—端行动—数据回流:云端负责模型训练和迭代,边缘侧承担低延迟推理,机器人完成最终执行,真实环境产生的数据再返回云端。
小朴Simbot进入酒店场景后,这条链路有了真实的应用场景。机器人面对真实空间、人员和任务产生的数据,可以重新进入云端训练体系,为后续模型优化提供依据。
从模型训练到真实物理场景应用,九章智算云将算力、数据、缓存、RL和训推组织在同一套基础设施中:VKS提供弹性资源,高性能存储和模型缓存保障数据供给,Serverless+RL承接后训练任务,云边协同则将训练结果带入机器人。
一套围绕具身智能研发流程组织起来的基础设施能力正在逐渐展现。九章智算云以弹性算力动态调度为核心,将存储、缓存、强化学习(RL)以及云边训推能力纳入统一体系,使算力能够随模型训练、后训练和部署任务动态变化,并持续支撑模型从云端训练走向真实机器人。对深朴智能而言,九章智算云提供的并非固定规模的算力,而是能够伴随具身智能模型持续训练、迭代和部署而动态调整的AI计算基础设施。
推荐阅读:
-
娱乐新势力、互动再升级 高达中国计划发布 万
高达中国计划(简称GCP)正式发布。2021年,实物大自由高达立像将会震撼登场,这将会成为上海新的消费旅游地标,以及众多高达粉丝的圣地。在7月11日线上举行的G...
2020-07-13 -
秋刀鱼又硬又小为啥日本人那么爱它?哈尔滨网友
秋刀鱼又硬又小,为啥日本人那么爱它?了解原因:只怪我知识浅薄。秋刀鱼是日本的一种名菜,日本人最喜欢这种肉食。比起鱼子酱,更多的日本人喜欢吃秋刀鱼,当地人把这种鱼...
2020-02-12 -
一口电饭锅就能做的六道烤箱美食,快来学习一下
对普通的家庭来说,日常的各种吃食一般用不到烤箱,所以厨房也就一直没有配备烤箱,那么在这个时候如果自己想吃一些好吃的美食的话,除了去外面店买之外也没有其他得更好的...
2020-02-12 -
不要再买枣糕了,教你在家自己做,香甜可口,比
枣糕可以说是一种从小吃到大的甜食,从小就喜欢枣糕的味道,每次去超市或者蛋糕店的时候总是要买上几块吃。味道特别丰富,红枣的味道充斥在其中,香甜可口,特别诱人。现在...
2020-02-12 -
世界十大冰激凌排行榜 世界顶级冰激凌品牌
爱吃冰淇淋的你知道世界十大冰激凌排行榜是怎么样的吗?哈根达斯、COLD STONE、VIVOLI GELATO、COPPELIA、BERTHILION、Dair...
2020-02-12 -
四菜一汤,精美套餐
可乐鸡翅鸡翅中 8个可乐 半瓶葱 适量姜 2片生抽 适量料酒 适量冰糖 5粒老抽 少许盐 适量鸡精 适量1.把鸡翅洗净后背面划几刀,正面用牙签扎些小眼方便入味。...
2020-02-12 -
无法拒绝的温暖,甜蜜的中式甜品了解一下
现在的人一说到甜品,就会想到蛋糕、马卡龙、蛋挞还有各种派这样子的西式甜品,不得不说,在甜品这方面西方确实做得很好。但西式甜品的入侵,也导致了许多人对于我们传统的...
2020-02-12
