<b id="nqvhe"><source id="nqvhe"><menu id="nqvhe"></menu></source></b>

    1. <source id="nqvhe"></source><xmp id="nqvhe"></xmp>
      1. <b id="nqvhe"></b>
        <u id="nqvhe"></u>
      2. <b id="nqvhe"><address id="nqvhe"><ol id="nqvhe"></ol></address></b>
      3. <source id="nqvhe"></source>
        <xmp id="nqvhe"><video id="nqvhe"></video></xmp>
          <b id="nqvhe"></b>
          <u id="nqvhe"></u>
        1. ABB202607
          關注中國自動化產業發展的先行者!
          2026具身智能·邊緣計算賦能新質智造峰會
          人工智能+制造融合創新研討會
          2026中國自動化產業年會
          2025工業安全大會
          OICT公益講堂
          當前位置:首頁 >> 資訊 >> 行業資訊

          資訊頻道

          WAIC 2026 | 面壁智能首個具身智能成果 MiniCPM-Robot 系列模型正式發布!
          • 點擊數:514     發布時間:2026-07-20 21:11:09
          7 月 19 日上午,面壁智能主辦的「智在終端 惠及千行」分論壇在世界人工智能大會上圓滿舉行。論壇上,面壁智能聯合 OpenBMB 正式發布并開源了其首個具身智能技術成果 MiniCPM-Robot 系列模型,「小鋼炮」正式進軍機器人領域!
          關鍵詞:

          7 月 19 日上午,面壁智能主辦的「智在終端 惠及千行」分論壇在世界人工智能大會上圓滿舉行。論壇上,面壁智能聯合 OpenBMB 正式發布并開源了其首個具身智能技術成果 MiniCPM-Robot 系列模型,「小鋼炮」正式進軍機器人領域!

          本次發布的 MiniCPM-Robot 系列成果包括兩個具身智能模型:通用 VLA 模型 MiniCPM-RobotManip,與面向移動機器人跟蹤導航的 MiniCPM-RobotTrack

          MiniCPM-RobotManip 基于面壁智能最新多模態端側模型 MiniCPM-V 4.6 訓練完成,延續了 MiniCPM-V 4.6 「小尺寸、高性能」與視覺 Token 極致壓縮的技術優勢,以僅 1.5B 的參數規模實現 比肩體量更大的3-4B模型的性能、但流式實時推理計算成本減半,模型支持 1 分鐘的具身原生記憶,從而能夠高效完成考驗上下文記憶的操作任務。

          MiniCPM-RobotTrack 由面壁智能和南京大學合作研發,是 業內首個支持真實本地斷網部署的跟蹤(Tracking)模型,首次實現純視覺的本地自主指令追蹤。模型原生適配宇樹 Go2 Edu ,僅依靠原裝攝像頭和本地算力即可完成單目標、動態多目標及模糊目標跟蹤,穩定達到 5+ Hz,端到端響應時延約 180 毫秒,并構建了自進化數據管線、能夠持續提升復雜動態環境下的跟蹤能力。


          通用 VLA

          MiniCPM-RobotManip

          MiniCPM-RobotManip 是一款面向機器人操作的 1.5B 通用 VLA 模型保留了面壁智能多模態基礎模型 MiniCPM-V 4.6 的通用理解能力,并基于多任務進行統一訓練,讓同一模型學習處理不同指令和操作任務。

          根據主流 VLA 基準測試,MiniCPM-RobotManip 的綜合性能位列 VLA 模型的第一梯隊,與 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表現。

          尤其是在考驗 VLA 模型上下文記憶的 RMBench 上,MiniCPM-RobotManip 更是明顯超越多個主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近隨機的水平。如下圖,模型可以先蓋住不同顏色方塊后 ,以紅綠藍順序揭開,體現其原生上下文能力,當前主流基于單幀反應式的VLA是做不到的。

          MiniCPM-RobotManip 將 MiniCPM-V 4.6 的視覺 Token 高效壓縮優勢進一步應用于機器人場景,大幅降低了機器人的視覺輸入計算量與推理時延,使機器人在保留1分鐘上下文記憶后的推理成本與傳統單幀反應式的推理成本相當——換言之,模型性能更優、部署成本卻更低

          根據測試,在包含 60 幀歷史觀測 的機器人操作任務中,傳統重新計算方式每個決策步需要 125 TFLOPs采用流式推理后僅需 3.3 TFLOPs,低于 π0.5 在無歷史幀輸入下的 5.0 TFLOPs。在 H100、BF16 精度下,MiniCPM-RobotManip 單決策步推理時延為 120ms相比 π0.5 的 234ms 降低近一半,實現了上下文記憶與響應效率的兼顧。

          首個本地斷網部署跟蹤模型

          MiniCPM-RobotTrack

          MiniCPM-RobotTrack 是一款 0.9B 端到端視覺指令跟蹤模型,具有以下三個技術優勢:

           01  三項跟蹤任務領跑開源 SOTA 

          我們從單目標跟蹤(STT)、動態多目標跟蹤(DT)和模糊目標跟蹤(AT)三類典型場景維度對 MiniCPM-RobotTrack 進行了評測。

          在僅有 0.9B 參數且未進行下游強化學習優化的情況下,MiniCPM-RobotTrack 在三項任務中的追蹤率分別達到 89.8、73.4 和 80.4,取得開源方案最優結果,相比 OmTrackVLA 分別提升 7.0、14.6 和 6.5 個百分點

          在相同的單視角、純 SFT(監督微調訓練)設定下,與其他閉源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在單目標跟蹤和模糊目標跟蹤任務上的追蹤率分別提升 8.8 和 17.0 個百分點,模糊目標跟蹤任務的成功率達到 58.0%。這表明,通過高質量數據和端到端訓練,輕量級模型無需依賴多視角輸入或下游 RL,也能獲得具有競爭力的真實場景指令追蹤能力

           02  自進化數據管線,讓模型在實踐中越用越強 

          針對真機數據采集成本高、長尾場景覆蓋有限等問題,MiniCPM-RobotTrack 構建了自進化數據管線,先通過自動檢測與人工復核清洗異常軌跡、錯誤動作等低質量數據,再引入面向具身追蹤的 DAgger 策略,讓模型在仿真與真機交互中主動暴露薄弱環節,針對快速轉向、短時遮擋、多人交叉等復雜場景持續補充高價值樣本,在數據閉環中提升跟蹤與泛化能力。

           03  真機實測 5+ Hz,斷網也能自主跟蹤 

          經過對宇樹 Unitree Go2 完整運行鏈路的系統性優化,MiniCPM-RobotTrack 模型在機器狗原生本地算力下穩定達到 5+ Hz,端到端響應時延約 180 毫秒

          在真機 Demo 中,即使現場拔掉網卡,機器狗仍能依靠本地視覺畫面與文本指令持續完成目標識別、跟蹤與運動控制。該能力可應用于樓宇巡檢、人員陪護和園區安防,未來有望拓展至災害救援、特種作業等弱網、斷網或強干擾場景。

          本次開源還將提供完整部署流程與一鍵啟動腳本,覆蓋模型加載、攝像頭接入、文本指令輸入和機器人控制接口,真正實現純本地部署、開箱即用。

          具身智能推理框架

          PhyAI

          此次發布的兩款模型均獲得了 PhyAI 的推理支持。

          PhyAI 是一款面向 Physical AI 的開源推理框架,專為端側極速推理與云端 RL 大規模 Rollout 場景設計。與模型官方倉庫相比,PhyAI 在 NVIDIA GeForce RTX 5090 上運行 π0、π0.5 和 GR00T 時,分別實現了約 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分別實現約 1.40 倍和 4.31 倍加速。面對 VLA、WAM 等模型結構快速演進、架構差異顯著的現狀,PhyAI 將易用性與靈活性置于首位,致力于降低模型從研究原型走向高效推理的適配成本。

          通過簡潔的 API,PhyAI 在發布首日即完成了對 MiniCPMRobot 的適配支持,并使用 CUDA Graph 進行加速,推理幀率從 10.12 Hz 提升至 33.28 Hz,同時還采取了算子融合的方法,使用triton編寫了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等為 MiniCPMRobot 定制的融合算子,減少中間變量的搬運次數,將其在 NVIDIA H20 上的推理幀率進一步提升至 36.77 Hz。

          讓端側 AI 走進千行萬業

          在推進開源技術的同時,我們也在與產業伙伴共同探索真實場景應用。

          目前,面壁智能已經與樂聚機器人合作推出展廳導覽和園區巡檢 Agent 解決方案,并與吉利汽車圍繞 VLA 模型、生產倉儲應用等方向展開合作,推動具身智能技術在實際環境中持續驗證和迭代。

          對面壁智能而言,探索物理 AGI 與長期追尋的 AGI 目標一脈相承。隨著機器人逐步進入家庭、辦公和工廠,本地感知、推理與決策將成為保障實時性、穩定性和數據隱私的重要方向。

          未來,我們將繼續投入具身領域,堅持通過開源與產業合作推動模型在真實場景中持續驗證,讓物理智能更加可靠、安全地走進現實世界。




          熱點新聞

          推薦產品

          x
          • 在線反饋
          1.我有以下需求:



          2.詳細的需求:
          姓名:
          單位:
          電話:
          郵件:

            <b id="nqvhe"><source id="nqvhe"><menu id="nqvhe"></menu></source></b>

            1. <source id="nqvhe"></source><xmp id="nqvhe"></xmp>
              1. <b id="nqvhe"></b>
                <u id="nqvhe"></u>
              2. <b id="nqvhe"><address id="nqvhe"><ol id="nqvhe"></ol></address></b>
              3. <source id="nqvhe"></source>
                <xmp id="nqvhe"><video id="nqvhe"></video></xmp>
                  <b id="nqvhe"></b>
                  <u id="nqvhe"></u>
                1. 国产精品高清视亚洲精品