10万小时轨迹拼出一套机器人动作底座
小米机器人团队于2026年7月16日发布Xiaomi-Robotics-1,并在同日提交技术论文。项目将其定义为视觉—语言—动作模型:机器人接收视觉观察和语言指令后,模型生成一段可供本体执行的动作,而不是只回答问题。北京市科学技术委员会、中关村科技园区管理委员会7月20日发布的科技盘点以及IT之家的同期报道,均确认了模型发布、超过10万小时训练数据及跨本体后训练等基本信息。论文7月22日更新至第二版,部分评测数字随版本订正,本文采用核验时可见的最新版本。
研发团队披露,预训练数据来自超过10万小时的真实世界操作轨迹,覆盖家庭、商业场所、工业现场和户外空间等1700余种场景。这些轨迹主要通过通用操作接口UMI采集:操作者使用带相机的夹爪完成拿取、整理和放置等动作,系统记录第一视角画面与夹爪运动。数据不依附某一种机器人本体,因此团队称其为“无本体”轨迹。长轨迹被切成固定长度片段,再由视觉语言模型描述夹爪和物体发生的状态变化,以减少十万小时数据全部依赖人工标注的成本。
预训练解决的是动作生成的广度,后训练则负责把这种能力接到具体机器人上。论文称后训练使用超过1万小时跨本体数据,包括内部采集、筛选后的公开机器人数据和人工标注UMI数据;项目主页明确披露其中超过7200小时为团队在真实住宅中采集的机器人数据,任务包括整理沙发、收纳鞋柜和放置厨具。后训练同时处理本体对齐和指令对齐:前者把UMI夹爪轨迹映射到移动操作机器人或双臂机器人,后者把描述“场景将如何变化”的训练目标改造成执行人类命令。
“开箱即用”是团队对后训练模型能力的表述,含义是模型可在未见环境和未见物体实例上直接执行一组移动操作任务,不等于任何机器人接入后都能立即稳定工作。论文的真实机器人测试显示,在相同后训练条件下,增加预训练数据或模型规模后,测试成功率上升;2B、5B和10B三个模型版本的整体成功率分别为61%、75%和79%。这些结果来自团队设定的环境与任务,并非面向所有本体、家庭或工厂条件的通用保证。
在四种新任务的微调实验中,团队为手机装箱、打印机耗材补充、衣物装入洗衣机和纸箱包装平均各使用不足10小时演示数据,报告Xiaomi-Robotics-1平均成功率为75%,对照模型π0.5为40%。每种方法在每项任务上评估10次,样本规模有限。仿真测试方面,论文第二版给出的平均成功率为RoboCasa 74.5%、RoboCasa365 57.4%、VLABench 59.1%和RoboDojo 13.93%;RoboDojo另有20.07的平均任务得分。北京市科委、中关村管委会页面对模型在这些基准上的进展作了概括,但没有提供独立复现实验。
项目主页还展示了持续十余分钟的行李打包演示。它说明团队正在尝试把导航、开柜、拿取和装箱串成长任务,不过单段演示无法回答不同房型、光照、物体摆放和设备故障下的稳定性。开放状态同样需要区分:小米已公开论文、项目主页和GitHub仓库,但截至2026年8月3日,GitHub仓库仍写明代码与模型权重将于稍后发布,仓库内主要是说明文件和论文;小米在Hugging Face的公开模型列表中也尚未出现Xiaomi-Robotics-1权重。因此,目前可以确认的是研究成果发布,不能写成代码、权重和完整部署工具已经开放。
从看懂指令到真正动手,差距在数据
机器人模型难以照搬语言模型的扩展路径,原因不只是参数量。文本可以从公开语料中批量获得,机器人操作数据却需要设备、场地、操作者和安全保障,错误动作还可能损坏物品或本体。Xiaomi-Robotics-1尝试先用不绑定机器人的UMI轨迹扩大训练面,再用较少的本体数据完成对齐。若这种方法能被外部团队复现,机器人研发可能从“每个任务、每种本体分别采集”转向“共享预训练能力,再做本体和任务适配”。真正关键的证据不是单次榜单名次,而是数据规模扩大后,真实机器人性能能否持续提高且部署成本没有同步失控。
基座模型把成本推向数据与本体适配环节
这一技术路线会把产业需求传导到操作数据采集设备、自动标注系统、数据清洗、仿真评测、训练算力和机器人中间件。整机厂仍需解决传感器标定、动作空间映射、控制频率、安全约束与故障恢复,模型供应方则要证明同一套预训练能力能够跨越不同机械臂、夹爪和移动底盘。小米同时拥有消费硬件、制造场景和机器人研发团队,具备内部试验条件;但现有公开材料没有披露Xiaomi-Robotics-1已经进入哪款量产产品,也没有给出客户部署、采购或收入数据。
工具链增量要等代码、试点和复购兑现
对机器人数据与开发工具行业而言,影响路径暂时是双向的。更多团队采用大规模预训练,可能增加UMI采集设备、数据治理、自动标注、仿真平台、算力和跨本体适配服务需求;基座模型若显著减少每个新任务所需的数据,又可能压低重复采集和定制训练的工作量。对小米及潜在合作方,经营贡献要经过代码或接口开放、样机接入、客户试点、验收和持续部署才能成立。观察期限偏长期,置信度仍待验证,不能根据论文成绩推断产品销量、公司利润或证券价格。
论文成绩仍困在自报与受控评测里
目前的主要结果由小米机器人团队自行设计实验并报告,论文是arXiv预印本,尚不能替代同行评审和第三方复现。仿真基准便于比较算法,却无法完整覆盖机械磨损、通信延迟、遮挡、儿童或宠物干扰以及人机安全。真实机器人微调实验每项只有10次评估,长时行李打包也以演示视频为主。论文不同版本曾出现RoboCasa365成功率数字调整,说明引用时需要锁定版本。更现实的限制是代码和权重尚未开放,外部研究者还无法按公开材料完整重跑训练、检查数据构成或验证跨本体迁移成本。
下一步先看权重开放,再看外部复现
后续应先检查GitHub和Hugging Face是否出现可运行代码、模型权重、许可证、推理配置及支持的机器人清单。第二步是观察RoboCasa365、RoboDojo等基准是否收录可核查提交,以及第三方能否复现论文结果。进入真实场景后,更重要的指标包括连续任务成功率、人工接管频次、单次故障恢复时间、推理延迟、安全事件和单位任务成本。若小米披露具名试点,还要区分内部工厂验证、合作方测试和正式商业交付;只有持续运行、验收与复购记录,才能说明基座模型开始转化为稳定经营能力。
