E-MARS

技术开发竞赛 · NVIDIA × StepFun · 让 Agent 创作一切

E-MARS
让 Agent 创作行动

E-MARS(Edge-deployed Multimodal Agent for Robotic Search-and-rescue),中文全称为“基于端侧多模态 AI Agent 的自主消防救援机器人”。“创作”不只发生在文字、图像与视频里:DGX Spark 既让断电、断网的楼宇救援 Agent 能在现场创作行动,也让科研人员把大型多模态模型、仿真和机器人闭环带到端侧。

2快 / 慢多模态 Agent 路径
4+3共同构成空间理解的视觉视角
DGXSpark 端侧科研工作站
Action从内容生成走向行动生成

01 · Origin

一个必须离线的场景,
一种新的端侧科研范式。

火灾救援回答了“为什么必须在现场计算”;科研实践则回答了“为什么传统嵌入式算力已经不够”。DGX Spark 把这两个问题连接在同一台紧凑设备上。

把多模态创作延伸到物理世界

拿到 DGX Spark 后,我们先问了一个比“能跑多大的模型”更重要的问题:什么任务真正需要现场端侧算力,而不是云端服务?单纯的数据安全可以通过隔离机房解决,偏远区域也可能通过专网或卫星链路补充连接;但消防救援提供了更明确的答案。

楼宇深处的移动通信覆盖往往依赖室内分布系统和微基站。一旦火灾造成全楼断电,室内网络可能随之中断,而此时救援 Agent 恰恰需要自主感知、探索环境、寻找目标并规划撤离方向。它不能等待云端恢复。因此我们构建了一套可离线运行、可观测、可安全收口的具身智能体工作流:大模型在现场理解与规划,确定性的导航组件把决策可靠地变成行动。

01 · INCIDENT建筑发生火灾烟雾、遮挡与陌生空间让远程人工判断变得困难。
02 · POWER全楼电力中断室内通信设施与既有信息系统可能同时失效。
03 · NETWORK云端链路不可依赖救援任务仍需要即时感知、规划和连续决策。
04 · LOCAL AGENTDGX Spark 现场决策多模态 Agent 离线创作探索路径、导航动作与环境摘要。

Research at the Edge

DGX Spark 重新定义了“端侧科研”能做什么

过去,机器人科研常把 Jetson 作为端侧计算核心。它在低功耗传感器处理、计算机视觉和产品化部署上依然重要;但当研究进入大型视觉语言模型、多模型常驻、长上下文推理,以及仿真、ROS 2 和模型服务并行运行时,内存容量与计算余量会直接决定实验能不能开始。

DGX Spark 把 128GB 统一内存和 Grace Blackwell AI 算力带到桌面与现场,使科研人员不必先把问题压缩成“端侧能跑的小模型”,而可以先用接近完整能力的模型验证算法,再决定如何蒸馏、量化和下放。这不是简单替换 Jetson,而是在嵌入式部署层之上增加了一层可随机器人进入现场的 AI 研究工作站

EMBEDDED EDGE Jetson:部署型端侧计算

擅长低功耗、实时传感器管线、机器人控制与已经优化完成的模型部署。

当研究需要同时驻留大模型、慢规划器、仿真与多路视觉服务时,资源边界容易提前限制问题规模。
RESEARCH EDGE DGX Spark:研究型端侧超算

面向本地大型模型与 Agent 原型,让推理、仿真、评测和机器人工作流在现场快速迭代。

128GB 统一内存 · 最高 1 petaFLOP FP4 · 单机支持开发测试最高约 200B 参数模型。

02 · Journey

从创作判断,
到创作行动。

第一阶段让 Agent 在仿真世界中完成观察、决策与执行;第二阶段把这套多模态工作流推向真实机器人、完整传感器和公开操作面板。下面记录的是关键决策,不是实验成绩单。

PHASE 01

先审计任务,而不是先堆模型

TASK AUDITFAIL CLOSED

早期我们同时调研 OmniNav、InternNav 与多种慢模型路线。一次重要的路线判断是:检查点、数据集、任务定义和动作空间必须完全匹配,任何缺失都应该在启动前明确阻断。这个阶段形成了后续一直沿用的分级门禁——场景、协议、单集、短批次、完整闭环逐级放行。

PHASE 02

跑通 InternVLA 与 Isaac 基线

INTERNVLAISAAC SIMRGB-D

模型常驻在 DGX Spark,Isaac 端负责场景、相机、位姿和 episode 生命周期。128GB 统一内存使我们能够围绕接近完整规模的视觉语言模型开展研究,而不是先被传统端侧资源筛掉候选。双方通过稳定协议交换自然语言、RGB‑D、历史观测与结构化动作,也为后续双机部署打下基础。

PHASE 03

让动作进入 ROS 2 / Nav2

ROS 2NAV2ADAPTER

我们没有让视觉语言模型直接输出速度,而是增加动作适配层:解析局部轨迹或离散动作,完成坐标变换、时效与身份检查,再交给 Nav2 做路径跟随、局部避障和停止。模型负责“去哪里、为什么”,导航栈负责“怎么走、何时停”,控制链由此获得清晰边界。

PHASE 04

T4:把系统拆成可验证模块

SENSORSLOCALIZATIONRECOVERY

传感器新鲜度、静态地图与局部代价地图、定位源选择、无进展检测、取消目标和恢复动作被拆成独立组件。Nvblox 与 cuVSLAM 作为可切换能力接入,同时保留明确回退路径。模块化不是为了目录整齐,而是为了在出现偏差时,能回答究竟是感知、定位、规划还是执行出了问题。

PHASE 05

T5:建立双 Lane 资源编排

DGX LANESRESOURCE LEASEPROVENANCE

两条推理与仿真 Lane 使用独立 GPU、CPU、ROS domain、命名空间、端口和结果根目录。所有在线重任务必须先获得共享资源租约,同时申请两项资源时使用固定顺序避免死锁。每个候选都绑定代码版本、配置哈希与数据身份,让并行开发不会演变成互相覆盖的“玄学调参”。

PHASE 06

Step3‑VL 进入真实语义链

STEP3-VL-10B4-VIEWSLOW PLANNER

Step3‑VL 从离散视点选择开始,逐步扩展到保存快照的离线回放、四相机同步观察,以及在线的有界语义顾问。它读取左前、正前、右前、后视画面和自然语言目标,输出场景摘要、目标证据、受阻方向、推荐候选与置信度,为快速控制链补上更长时间尺度的语义判断。

PHASE 07

从仿真走向真实 Go2 与公开面板

UNITREE GO2D435OPERATOR UI

第二条主对话完成了 Go2 官方 ROS 2 通信、D435 RGB‑D、LiDAR、前相机和四路环视相机的接入。Go2 原生前摄视角较低,我们通过增加 D435 获得更适合导航的彩色与深度观察,再用前、后、左、右相机形成近 360° 环境信息。随后,运行状态被整理为独立 Operator Panel,让操作员同时看到任务、结构化决策、执行链、机器人状态和本地推理资源。

03 · Control Chain

模型不是驾驶员,
它是决策系统的一部分。

控制链采用“语义智能 + 确定性执行”的分层结构。所有消息携带 episode、reset、sequence 与 snapshot 身份,旧观测和跨轮次动作不会被误接到当前机器人状态。

NVIDIA ISAAC SIM / ISAAC LABSIMULATION
USD 场景 + Go2 物理世界、碰撞与运动反馈
RGB‑D / LiDAR / IMUOdom / Clock
Episode / Reset / Evaluator任务身份与评测生命周期
本地智能体控制链EDGE AGENT
ROS 2 Sensor Bridge类型化观测入口
身份与运动观测门episode / reset / snapshot
InternVLA 快速导航局部轨迹 / 动作
Step3‑VL 语义慢规划语义候选决策
Typed Command Resolver快慢路径统一解析
Nav2规划、控制与恢复
Watchdog + Go2 Bridge有界运动执行
ROS 2 Bridge 支路
定位 / Nvblox / Costmap位姿、空间融合与可达性
汇入 Resolver
正常闭环

InternVLA 负责快速局部决策,Nav2 负责连续执行;动作完成后立刻用新观测更新历史。

语义慢规划

当目标证据、候选选择或恢复方向需要更强语义判断时,Step3‑VL 对冻结的候选集合进行多视角比较。

04 · StepFun

Step3‑VL:
创作对空间的
深层理解。

Step3‑VL 是系统的多视角语义慢规划层。它结合自然语言目标、场景图像、导航历史和可达候选,为 frontier、viewpoint 或运动 primitive 提供语义比较和高层决策,并与 InternVLA 快速路径在统一命令解析层汇合。

这种分工把模型能力放在最合适的位置:视觉语义、目标对齐、跨视角比较和策略建议;随后由既有的身份门、Nav2 与安全执行链把建议转化为可控动作。

01

多视角场景理解

同时读取左前、正前、右前与后视画面,建立比单帧更完整的空间语义,识别门洞、通道、家具、遮挡和可能的目标线索。

02

自然语言目标落地

把“走向客厅里的沙发”“穿过门后寻找桌子”这样的指令,与当前画面中的实体、方向和可行区域建立联系。

03

候选方向与 frontier 排序

在 Nav2 或快速路径给出的合法候选集合中比较前进、左转、右转、视点或 frontier,让语义判断进入真实控制链,同时保留确定性的动作边界。

04

事件触发的深思考

在观测受限、局部超时、目标证据变化或恢复阶段触发慢规划,输出场景摘要、证据、受阻方向、推荐候选、置信度与是否继续观察。

05

结构化决策与可观测性

推理结果被压缩为稳定 JSON 合同,操作面板只展示允许公开的决策摘要,不暴露隐藏推理、原始提示或内部文件路径。

SINGLE · REAL-TIME

单机构型

Step3‑VL 结合环视图像与 D435 深度信息,承担高实时性语义导航,在紧凑部署中完成观察、方向判断与动作建议。

DUAL · EXPLORATION

双机构型

Step 3.7 Flash 作为高层多模态 Agent,面向自主环境探测、任务分解与信息汇总;快速导航链在另一计算节点持续执行与反馈。

05 · Technology

DGX Spark 支撑的
多模态创作工作流。

DGX Spark 不是一台被动运行单个模型的服务器,而是 Agent 的本地创作引擎:在同一算力平台上组织视觉理解、快速决策、语义慢规划、结构化输出与运行观测。

STEPFUN & VLA MODELS

多模态推理与具身决策

  • Step3‑VL‑10B · 多视角语义慢规划
  • Step 3.7 Flash · 高层 Agent 与环境探测
  • InternVLA / InternNav · 快速导航策略
  • vLLM · 本地 OpenAI 兼容推理服务
  • 结构化候选协议 · 可验证决策
  • 常驻模型服务 · 跨 episode 复用
  • 事件触发 · 快慢路径协同
ROBOTICS RUNTIME

导航、传感器与产品界面

  • ROS 2 Jazzy · 通信与生命周期
  • Nav2 · 路径执行、局部避障与恢复
  • Unitree Go2 · 真实机器人平台
  • Intel RealSense D435 · RGB‑D
  • LiDAR + 四路环境相机 · 现场观测
  • FastAPI / WebSocket · Operator Panel
分类技术 / 模型项目中的作用
NVIDIA SDKIsaac Sim 6.0.0.1Go2、USD 场景、物理、相机和传感器仿真。
NVIDIA SDKIsaac Lab 6.1.14Go2 环境、传感器和仿真任务封装。
NVIDIA SDKIsaac ROS release 4.5NVIDIA ROS 2 感知与加速组件。
NVIDIA SDKIsaac ROS NvbloxRGB‑D / LiDAR 空间融合和 Nav2 costmap。
NVIDIA SDKIsaac ROS Visual SLAM / cuVSLAM视觉定位、里程计与可切换位姿来源。
NVIDIA SDKOmniverse Kit / USD / PhysX场景管理、渲染、USD 资产、碰撞与物理查询。
仿真数据集Matterport3D(MP3D)/ R2R提供室内三维场景与 val_unseen 导航任务,用于 Isaac Sim 导航仿真与评测。
NVIDIA 平台DGX Spark / NVIDIA GB10本地多模态大模型、Agent 服务和 ROS 2 导航计算。
NVIDIA 平台CUDA 13GPU 推理和感知加速。
NVIDIA 大模型Cosmos Reason2 32B BF16多视角慢规划研究路线与语义候选比较。
StepFun 模型Step3‑VL‑10B BF16场景理解、候选视点选择和高层导航决策。
StepFun 模型Step 3.7 Flash双机构型的环境探索、任务分解和阶段性总结。
导航模型InternVLA / InternNav高频视觉语言导航和局部轨迹 / 动作生成。
机器人中间件ROS 2 Jazzy组件通信、消息、服务、Action、生命周期与身份传播。
导航框架Nav2地图、规划、控制、costmap、恢复与有界目标执行。
推理框架PyTorch 2.12.1+cu130 + Transformers 4.57.6本地多模态模型加载、BF16 推理与结构化生成。
通信ROS 2 DDS、TCP / ZeroMQ、UDP模型、传感器、时钟、遥测和控制数据交换。
机器人Unitree Go2仿真导航目标与独立安全门控制的真机平台。

NVIDIA Isaac Stack

把机器人研发,
组织成一条完整工作流。

Isaac 的价值不只是仿真更快或画面更真实,而是让场景、物理、传感器、机器人学习、ROS 2 感知和 Nav2 导航共享连续、可复用的工程边界。E‑MARS 因此能先在可复现世界中验证,再沿用同一控制合同进入真实机器人。

01 · SIMULATION FOUNDATION

统一的仿真世界

Isaac Sim 用 Omniverse USD 统一表达建筑、Go2、相机和碰撞关系,由 PhysX 提供刚体运动与接触反馈。场景、材质、障碍或相机发生变化时,模型接口、坐标合同和评测结构仍可保持稳定。

02 · MODULAR ROBOT LEARNING

可复用的机器人学习模块

Isaac Lab 将机器人、传感器、环境、任务与配置组织成模块。直接工作流适合快速原型,manager-based 结构适合持续扩展,避免反复重写物理循环、观测组织和 reset 生命周期。

03 · GPU PERCEPTION

感知结果直接进入导航

Isaac ROS Nvblox 把深度与位姿融合为三维重建和 Nav2 代价地图;Visual SLAM / cuVSLAM 利用视觉与 IMU 提供里程计,使 GPU 感知自然接入 ROS 2 控制链。

04 · SIM-TO-REAL WORKFLOW

仿真与真机共享边界

E‑MARS 在 Isaac 中先验证 RGB‑D、TF、地图、costmap、路径与停止条件,再把同一模型服务和 Nav2 适配层接向 Go2。故障也能沿场景、传感器、定位、规划和控制逐层定位,而不是维护两套割裂系统。

USD / PHYSXRGB‑D / LIDAR / IMUISAAC ROSNVBLOX / CUVSLAMROS 2 / NAV2UNITREE GO2

NVIDIA DGX Spark 官方定位包含本地大型模型与 Agent 开发测试;Jetson Orin 则继续服务于高能效机器人和边缘部署,两者在本项目中是研究层与部署层的互补。Step 3.7 Flash 用于双机构型的高层环境探索。页面不发布模型权重、数据集或实验结果文件。

06 · Local Deployment

创作发生在本地,
行动也发生在本地。

智能体不依赖云端 API。DGX Spark 上的大模型、Isaac 仿真、ROS 2 与操作面板组成完整的本地多模态生产工作流,视觉内容、任务上下文和机器人状态不离开现场。

部署顺序

  1. 准备模型缓存与固定版本依赖,校验权重和配置身份。
  2. 在 DGX Spark 启动 InternVLA 与 Step3‑VL 常驻服务。
  3. 在仿真工作站启动 Isaac、ROS 2 bridge 与 Nav2。
  4. 加载 episode 或现场任务,建立相机、位姿和动作合同。
  5. 先通过健康检查与静态门禁,再放行导航闭环。
  6. 真机侧沿用同一 ROS 2 消息边界,逐级开放执行能力。
RESEARCH
DGX Spark:现场 AI 研究工作站

运行 InternVLA、Step3‑VL 与 Step 3.7 Flash 研究路径,并在本地完成结构化推理、快速迭代和资源观测。

SIMULATION
Isaac 工作站:世界与执行

运行 Isaac Sim、场景资产、相机渲染、ROS 2 bridge、Nav2 和评测生命周期。

POWER
原型供电:逆变器方案

原计划的 STM32 供电板受黑客松打样周期限制,原型阶段改用成熟逆变器完成 DGX 现场供电,优先保证系统按期形成可工作的救援演示闭环。下一阶段正在开发“电池 → USB PD 3.2 48 V”直供方案,目标是减少 DC‑AC‑DC 转换环节、体积与重量;完成协议协商、启动瞬态、欠压、过流和温升验证后,再替代演示阶段的逆变器链路。

ROBOT
Unitree Go2:真实反馈

提供机身状态、前相机、LiDAR 与运动接口;D435 和环境相机补充近场深度与多视角语义。

OPERATOR
VLA Nav Panel:统一观察入口

通过 allowlist 投影展示任务、相机、结构化决策、执行阶段和运行资源,不复制内部凭证与原始推理。

BF16 + 常驻服务避免每个 episode 重新加载模型,减少启动等待与显存抖动。
有界视觉协议固定四视角顺序、图像规格和快照身份,只发送决策所需信息。
确定性解码限制输出 schema 与 token 预算,让结果能被控制链稳定解析。
事件触发慢规划高频动作走快速路径,Step3‑VL 聚焦关键语义节点,提升算力利用率。
资源隔离GPU、CPU、ROS domain、端口和结果目录按 Lane 分离,在线任务必须持有租约。
安全回退超时、过期、跨 reset 或非法候选都会回到冻结策略并执行有界停止。

What We Built

Agent 创作的,
不只是答案,
而是下一步行动。

E-MARS 对「让 Agent 创作一切」的回答有两层:面向救援,把创作从数字内容延伸到断网现场;面向科研,把端侧从“部署优化后模型的终点”变成“研究大型 Agent 的起点”。依托 NVIDIA DGX Spark,Step3‑VL 创作实时空间语义,Step 3.7 Flash 组织高层环境探索,InternVLA 生成快速局部决策,ROS 2 / Nav2 将它们变成可执行、可反馈的机器人行动。

回到顶部 ↑

Source Code · Documentation

从架构说明,
继续走进完整源码。

E‑MARS 主仓集中提供 ROS 2 / Nav2 控制核心、InternVLA 与慢规划接口、Isaac 仿真运行时、传感器与恢复组件,以及公开的部署和技术栈文档。

打开 GitHub 源码