字节跳动发布Astra双模型架构,赋能通用移动机器人导航
字节跳动推出名为Astra的新型双模型机器人导航架构,包含全局模型Astra-Global与局部模型Astra-Local,分别处理低频定位与高频实时路径规划任务。该架构基于混合拓扑-语义图与多模态大语言模型(MLLM),支持图像/自然语言驱动的精准室内定位,已在论文与开源网站(astra-mobility.github.io)公开技术细节。
突破传统导航瓶颈:Astra应需而生
随着机器人在工业制造、仓储物流及家庭服务等场景加速落地,复杂室内环境下的自主导航能力成为关键瓶颈。现有系统通常依赖多个独立、规则驱动的小模块分别处理目标定位、自定位与路径规划,难以应对重复结构(如仓库)、动态障碍与模糊指令等挑战。为系统性解决‘我在哪?’‘我要去哪?’‘怎么到达?’三大核心问题,字节跳动研发出Astra——一种面向通用移动机器人的分层多模态导航架构。
双模型协同:System 1与System 2范式落地
Astra采用类人类认知的System 1(快速直觉)/System 2(慢速推理)设计,由两大子模型构成:Astra-Global负责低频、高精度全局任务(自定位与目标定位),Astra-Local专注高频、实时局部任务(局部路径规划与里程估计)。二者分工明确、协同工作,避免传统单一大模型在响应延迟与计算开销间的折衷困境。
Astra-Global:多模态语义定位引擎
作为Astra的‘智能大脑’,Astra-Global是一个多模态大语言模型(MLLM),以Qwen2.5-VL为骨干,融合视觉与语言输入实现厘米级地图内定位。其核心创新在于构建并利用混合拓扑-语义图(G=(V,E,L)):节点V为SfM重建的关键帧(含6DoF相机位姿),边E表征节点间空间连通性,语义标签L则由模型从各节点图像中自动提取功能化地标(如‘蓝色货架左上角’‘饮水机旁绿植’),并通过共视关系关联多节点。该图在离线建图阶段一次性生成,为后续在线定位提供强语义上下文。
视觉-语言定位:粗粒度匹配+细粒度精调
实际定位过程采用两阶段机制:粗阶段接收查询图像或文本指令,检测并匹配预建地标库,筛选视觉一致候选;细阶段基于粗结果,在离线地图中采样参考节点,联合比对视觉特征与空间位姿,直接输出6DoF预测位姿。对语言指令(如‘去会议室B旁边的咖啡机’),模型解析语义功能描述,通过地标-节点映射机制检索对应地图节点,返回目标图像与精确位姿。
训练策略:监督微调+组相对策略优化
为提升零样本泛化能力,团队采用两阶段训练:第一阶段使用多样化数据集进行监督微调(SFT),覆盖粗/细定位、共视检测与运动趋势估计;第二阶段引入组相对策略优化(GRPO),设计包含格式合规性、地标提取准确率、地图匹配度及额外地标奖励的规则化奖励函数,显著提升视觉-语言联合定位鲁棒性。实验表明,GRPO使Astra-Global在未见场景下的零样本定位准确率大幅提升。
开源与展望
相关研究论文《Astra: Toward General-Purpose Mobile Robots via Hierarchical Multimodal Learning》已公开,配套代码与技术文档发布于官网(https://astra-mobility.github.io/)。目前Astra聚焦室内静态环境导航,未来将拓展至动态避障、跨楼层导航及多机器人协同等方向。
> 编者观点:Astra并非单纯算法升级,而是将大模型能力深度嵌入机器人感知-决策闭环的设计范式转变。对中国具身智能企业而言,其“离线建图+在线轻量推理”架构与语义图构建方法,为低成本、可扩展的商用机器人导航提供了可复用的技术路径。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(Synced) →