7 月 19 日上午,面壁智能主辦的「智在終端 惠及千行」分論壇在世界人工智能大會上圓滿舉行。論壇上,面壁智能聯合 OpenBMB 正式發布并開源了其首個具身智能技術成果 MiniCPM-Robot 系列模型,「小鋼炮」正式進軍機器人領域!
本次發布的 MiniCPM-Robot 系列成果包括兩個具身智能模型:通用 VLA 模型 MiniCPM-RobotManip,與面向移動機器人跟蹤導航的 MiniCPM-RobotTrack。
MiniCPM-RobotManip 基于面壁智能最新多模態端側模型 MiniCPM-V 4.6 訓練完成,延續了 MiniCPM-V 4.6 「小尺寸、高性能」與視覺 Token 極致壓縮的技術優勢,以僅 1.5B 的參數規模實現 比肩體量更大的3-4B模型的性能、但流式實時推理計算成本減半,模型支持 1 分鐘的具身原生記憶,從而能夠高效完成考驗上下文記憶的操作任務。
MiniCPM-RobotTrack 由面壁智能和南京大學合作研發,是 業內首個支持真實本地斷網部署的跟蹤(Tracking)模型,首次實現純視覺的本地自主指令追蹤。模型原生適配宇樹 Go2 Edu ,僅依靠原裝攝像頭和本地算力即可完成單目標、動態多目標及模糊目標跟蹤,穩定達到 5+ Hz,端到端響應時延約 180 毫秒,并構建了自進化數據管線、能夠持續提升復雜動態環境下的跟蹤能力。
通用 VLA
MiniCPM-RobotManip
MiniCPM-RobotManip 是一款面向機器人操作的 1.5B 通用 VLA 模型,保留了面壁智能多模態基礎模型 MiniCPM-V 4.6 的通用理解能力,并基于多任務進行統一訓練,讓同一模型學習處理不同指令和操作任務。
根據主流 VLA 基準測試,MiniCPM-RobotManip 的綜合性能位列 VLA 模型的第一梯隊,與 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表現。
尤其是在考驗 VLA 模型上下文記憶的 RMBench 上,MiniCPM-RobotManip 更是明顯超越多個主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近隨機的水平。如下圖,模型可以先蓋住不同顏色方塊后 ,以紅綠藍順序揭開,體現其原生上下文能力,當前主流基于單幀反應式的VLA是做不到的。
MiniCPM-RobotManip 將 MiniCPM-V 4.6 的視覺 Token 高效壓縮優勢進一步應用于機器人場景,大幅降低了機器人的視覺輸入計算量與推理時延,使機器人在保留1分鐘上下文記憶后的推理成本與傳統單幀反應式的推理成本相當——換言之,模型性能更優、部署成本卻更低。
根據測試,在包含 60 幀歷史觀測 的機器人操作任務中,傳統重新計算方式每個決策步需要 125 TFLOPs,采用流式推理后僅需 3.3 TFLOPs,低于 π0.5 在無歷史幀輸入下的 5.0 TFLOPs。在 H100、BF16 精度下,MiniCPM-RobotManip 單決策步推理時延為 120ms,相比 π0.5 的 234ms 降低近一半,實現了上下文記憶與響應效率的兼顧。
首個本地斷網部署跟蹤模型
MiniCPM-RobotTrack
MiniCPM-RobotTrack 是一款 0.9B 端到端視覺指令跟蹤模型,具有以下三個技術優勢:
01 三項跟蹤任務領跑開源 SOTA
我們從單目標跟蹤(STT)、動態多目標跟蹤(DT)和模糊目標跟蹤(AT)三類典型場景維度對 MiniCPM-RobotTrack 進行了評測。
在僅有 0.9B 參數且未進行下游強化學習優化的情況下,MiniCPM-RobotTrack 在三項任務中的追蹤率分別達到 89.8、73.4 和 80.4,取得開源方案最優結果,相比 OmTrackVLA 分別提升 7.0、14.6 和 6.5 個百分點。
在相同的單視角、純 SFT(監督微調訓練)設定下,與其他閉源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在單目標跟蹤和模糊目標跟蹤任務上的追蹤率分別提升 8.8 和 17.0 個百分點,模糊目標跟蹤任務的成功率達到 58.0%。這表明,通過高質量數據和端到端訓練,輕量級模型無需依賴多視角輸入或下游 RL,也能獲得具有競爭力的真實場景指令追蹤能力。
02 自進化數據管線,讓模型在實踐中越用越強
針對真機數據采集成本高、長尾場景覆蓋有限等問題,MiniCPM-RobotTrack 構建了自進化數據管線,先通過自動檢測與人工復核清洗異常軌跡、錯誤動作等低質量數據,再引入面向具身追蹤的 DAgger 策略,讓模型在仿真與真機交互中主動暴露薄弱環節,針對快速轉向、短時遮擋、多人交叉等復雜場景持續補充高價值樣本,在數據閉環中提升跟蹤與泛化能力。
03 真機實測 5+ Hz,斷網也能自主跟蹤
經過對宇樹 Unitree Go2 完整運行鏈路的系統性優化,MiniCPM-RobotTrack 模型在機器狗原生本地算力下穩定達到 5+ Hz,端到端響應時延約 180 毫秒。
在真機 Demo 中,即使現場拔掉網卡,機器狗仍能依靠本地視覺畫面與文本指令持續完成目標識別、跟蹤與運動控制。該能力可應用于樓宇巡檢、人員陪護和園區安防,未來有望拓展至災害救援、特種作業等弱網、斷網或強干擾場景。
本次開源還將提供完整部署流程與一鍵啟動腳本,覆蓋模型加載、攝像頭接入、文本指令輸入和機器人控制接口,真正實現純本地部署、開箱即用。
具身智能推理框架
PhyAI
此次發布的兩款模型均獲得了 PhyAI 的推理支持。
PhyAI 是一款面向 Physical AI 的開源推理框架,專為端側極速推理與云端 RL 大規模 Rollout 場景設計。與模型官方倉庫相比,PhyAI 在 NVIDIA GeForce RTX 5090 上運行 π0、π0.5 和 GR00T 時,分別實現了約 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分別實現約 1.40 倍和 4.31 倍加速。面對 VLA、WAM 等模型結構快速演進、架構差異顯著的現狀,PhyAI 將易用性與靈活性置于首位,致力于降低模型從研究原型走向高效推理的適配成本。
通過簡潔的 API,PhyAI 在發布首日即完成了對 MiniCPMRobot 的適配支持,并使用 CUDA Graph 進行加速,推理幀率從 10.12 Hz 提升至 33.28 Hz,同時還采取了算子融合的方法,使用triton編寫了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等為 MiniCPMRobot 定制的融合算子,減少中間變量的搬運次數,將其在 NVIDIA H20 上的推理幀率進一步提升至 36.77 Hz。
讓端側 AI 走進千行萬業
在推進開源技術的同時,我們也在與產業伙伴共同探索真實場景應用。
目前,面壁智能已經與樂聚機器人合作推出展廳導覽和園區巡檢 Agent 解決方案,并與吉利汽車圍繞 VLA 模型、生產倉儲應用等方向展開合作,推動具身智能技術在實際環境中持續驗證和迭代。
對面壁智能而言,探索物理 AGI 與長期追尋的 AGI 目標一脈相承。隨著機器人逐步進入家庭、辦公和工廠,本地感知、推理與決策將成為保障實時性、穩定性和數據隱私的重要方向。
未來,我們將繼續投入具身領域,堅持通過開源與產業合作推動模型在真實場景中持續驗證,讓物理智能更加可靠、安全地走進現實世界。







資訊頻道