跳转至

Helix 模型与 AI 优先策略

引言

Figure AI 与多数人形机器人公司的根本区别在于把软件而非硬件视为主要护城河。其自研的 Helix 是一套视觉-语言-动作(Vision-Language-Action, VLA)基础模型,通过「系统 1 / 系统 2」双频架构把高层语义理解与高频运动控制解耦,目标是让同一套权重泛化到未见过的物体与任务上。本页面介绍 Helix 的架构设计、训练方式,以及由此衍生的「AI 优先」产品策略如何改变机器人的部署成本结构。

Helix 基础模型

概述

Helix 是 Figure AI 为 Figure 02 开发的机器人专用视觉语言基础模型(Vision-Language Foundation Model),也是 Figure AI "AI 优先"战略的核心技术载体。Helix 的设计目标是打通从自然语言指令和视觉感知到机器人物理动作之间的端到端链路(End-to-End Pipeline),使机器人能够在无需针对每个任务单独编程的前提下,理解并执行多样化的操作任务。

模型架构

Helix 采用分层架构(Hierarchical Architecture),将机器人控制问题分解为两个紧密耦合的层次:

高层语义层(High-Level Semantic Layer)

高层语义层负责处理来自机器人头部摄像头的 RGB 图像输入和来自操作员或用户的自然语言指令输入。该层基于大规模预训练的视觉语言模型,能够:

  • 理解任务语义(如"把红色零件放到传送带上")
  • 在视觉场景中定位目标物体
  • 规划任务步骤序列(Task Planning)
  • 评估当前任务执行状态并在必要时调整计划

低层运动控制层(Low-Level Motor Control Layer)

低层运动控制层接受来自高层语义层的目标状态(Target State)或关键姿态(Key Pose)作为输入,生成具体的关节力矩(Joint Torque)或关节轨迹(Joint Trajectory)指令,驱动机器人的四肢和手部执行实际动作。该层通常基于模型预测控制(Model Predictive Control, MPC)或学习型运动策略(Learned Motor Policy)实现。

两层之间通过统一的接口协议进行通信,高层语义层以较低的频率(约 5—10 Hz)输出语义级别的控制信号,低层运动控制层以更高的频率(约 200—1000 Hz)执行精细的关节控制。

零样本泛化能力

Helix 的核心优势之一是零样本泛化(Zero-Shot Generalization)能力,即在面对训练数据中从未出现过的新物体、新场景或新任务描述时,仍能生成合理的行动策略。

这一能力来源于大规模视觉语言预训练所积累的语义知识。具体而言,Helix 在预训练阶段学习了大量关于物体类别、空间关系、动作语义的通用知识,这些知识在微调(Fine-Tuning)和机器人具体任务训练阶段被迁移和专门化,使得模型在面对新任务时能够借助预训练知识进行合理推断。

以数学形式表达,Helix 的目标可以描述为学习一个策略函数 ,使得:

其中 时刻的视觉观测(Visual Observation), 为自然语言任务指令(Language Instruction), 为机器人在 时刻执行的动作(Action)。Helix 的零样本泛化能力意味着该策略函数在 描述的任务超出训练分布时仍能给出合理的

训练数据与学习流程

Helix 的训练流程分为多个阶段:

第一阶段:视觉语言预训练(VLP Pre-Training)

利用互联网规模的图像-文本配对数据对视觉编码器(Visual Encoder)和语言模型(Language Model)进行联合预训练,使模型学习通用的视觉-语义对齐(Visual-Semantic Alignment)能力。此阶段数据量通常在数十亿图文对规模,模型参数量从数十亿到数百亿不等。

第二阶段:机器人操作数据微调(Robot Manipulation Fine-Tuning)

在通用预训练模型基础上,使用机器人操作专属数据进行微调,包括:

  • 遥操作数据(Teleoperation Data):操作员通过遥操作设备(Teleoperation Device)控制机器人完成任务,同步记录机器人的视觉观测、关节状态和动作序列
  • 仿真数据(Simulation Data):在 MuJoCo、Isaac Sim 等物理仿真环境(Physics Simulation Environment)中自动生成大量操作轨迹,弥补真实数据稀缺的问题
  • 人类视频数据(Human Video Data):利用人类执行相似操作的视频数据,通过跨形态模仿(Cross-Embodiment Imitation)方法迁移人类操作技能

第三阶段:在线强化学习(Online Reinforcement Learning)

将微调后的模型部署到真实机器人上,通过自主试错(Trial-and-Error)收集交互数据,以任务完成率(Task Success Rate)为奖励信号,进一步优化策略。此阶段的数据质量远高于仿真数据,但收集成本也显著更高。

三阶段训练构成了一个从通用到专用、从仿真到真实的渐进精化(Progressive Refinement)流程,是当前机器人基础模型训练的主流范式之一。

与 OpenAI 合作的关系

2024 年 3 月的演示展示了 Figure AI 与 OpenAI 的早期合作成果:OpenAI 提供语言理解和推理能力,Figure AI 提供机器人硬件和低层控制能力,两者通过 API 接口(Application Programming Interface)耦合。Helix 的发展是在这一合作基础上的深化,Figure AI 逐步将语言理解模型与机器人控制深度融合,形成专为机器人操作任务优化的一体化基础模型,而非简单调用通用 LLM 接口。

值得注意的是,Helix 并非单纯将 GPT-4o 等通用模型直接用于机器人控制,而是针对机器人场景的独特需求做出了以下关键适配:

  • 时序建模(Temporal Modeling):机器人操作是时序过程,需要模型对历史动作和观测序列进行有效建模,而通用 VLM 主要处理静态图文对。Helix 引入了对动作历史的显式建模机制
  • 3D 空间感知(3D Spatial Perception):操作任务需要对物体三维位置和朝向的精确估计,Helix 在视觉编码阶段引入了深度信息(Depth Information)和立体视觉(Stereo Vision)处理能力
  • 实时性约束(Real-Time Constraint):机器人控制对推理延迟极为敏感,Helix 通过模型量化(Model Quantization)和硬件加速优化,将推理延迟控制在可接受范围内

AI 优先策略

传统机器人编程的局限

传统工业机器人的编程范式(Programming Paradigm)以"示教—再现"(Teach and Playback)为核心:工程师通过手动引导机器人运动轨迹或编写运动程序(Motion Program),将特定任务的操作步骤硬编码(Hard-Coded)到机器人控制器中。机器人随后精确重复这些预定义动作,几乎不具备对环境变化的自适应能力。

这种范式在高度结构化、高度重复的大批量生产(Mass Production)中效率极高,但存在以下根本性局限:

  • 部署成本高:每引入一种新任务,需要专业工程师重新示教和编程,部署周期以天到周计
  • 泛化能力差:当物体位置、姿态或环境布局发生细微变化时,预编程的机器人可能直接失败
  • 灵活性低:无法在任务之间动态切换,更无法处理非预期情况(Unexpected Situations)

Figure AI 的 AI 优先哲学

Figure AI 的 AI 优先(AI-First)策略是对上述局限的正面回应。其核心主张是:

机器人的"智能"不应来自人类工程师事先编写的规则和程序,而应来自从大规模数据中学习得到的通用能力模型。

具体体现在以下几个层面:

基础模型驱动(Foundation Model-Driven):使用在互联网规模数据上预训练的视觉语言基础模型作为机器人的"认知大脑",使机器人天然具备对日常物体、空间关系和人类指令的语义理解能力,而无需为每个物体类别单独编写识别程序。

端到端学习(End-to-End Learning):尽量减少人工设计的中间模块(如独立的物体检测模块、轨迹规划模块),让模型直接从原始感知输入(图像、语音)学习到动作输出,以减少模块间接口引入的误差积累和信息损失。

数据飞轮(Data Flywheel):通过在真实工厂环境中积累大量机器人操作数据,持续改进基础模型的能力,形成"部署越多、数据越多、模型越强、部署越成功"的正向循环。

与 OpenAI 合作的独特性

Figure AI 与 OpenAI 的合作不同于一般企业对 AI 能力的简单调用,其独特性体现在:

联合开发而非单纯 API 调用:双方团队深度合作,针对机器人操作场景的特殊需求(如对三维空间的精确感知、对物理接触的理解、对实时性的严格要求)对基础模型进行专项优化,而不仅仅是通过 HTTP 接口调用通用 GPT 模型。

具身智能(Embodied Intelligence)的共同探索:OpenAI 视此次合作为探索"具身智能"的重要实验场——通过真实物理交互积累经验,可能反过来促进更通用 AI 能力的发展。这种双向价值使合作超越了单纯的商业服务关系。

数据产权与安全:在工厂环境部署过程中收集的操作数据,其产权归属和使用权限是双方合作协议中的关键条款,也是整个机器人 AI 产业在数据战略层面面临的共同挑战。

与传统机器人编程范式的根本差异

为直观说明 AI 优先策略与传统范式的差异,以"将工件从料箱(Bin)中取出并放到传送带上"这一典型工业任务为例:

传统编程范式下的实现:工程师使用机器人视觉软件(如 HALCON 或 OpenCV)开发专用的工件识别程序,定义特征模板(Feature Template);使用运动规划软件(如 MoveIt)规划从识别位置到放置位置的轨迹;将整套程序部署到机器人控制器,调试参数直至达标。全程需要 1—4 周的工程时间,且当工件型号更换时需重新开发。

Helix AI 优先范式下的实现:操作员通过自然语言描述任务("从左侧料箱中取出蓝色零件,放到右侧传送带的入口处"),Helix 利用预训练知识理解"蓝色零件"的视觉特征、"料箱"和"传送带"的空间关系,直接生成操作策略。若任务描述或场景发生变化,只需更新自然语言指令,而无需修改任何代码。

这一对比揭示了 AI 优先策略的根本价值主张:将任务部署的成本从"工程师-周"压缩到"操作员-分钟"量级,从而在经济上实现人形机器人在中小批量、多品种生产场景中的商业可行性。

参考资料

  1. Figure AI, "Helix: A Vision-Language-Action Model for Generalist Humanoid Control," 2025. https://www.figure.ai/news/helix
  2. Figure AI 官方网站与技术博客. https://www.figure.ai/
  3. Figure 总览
  4. 视觉-语言-动作模型
  5. 具身智能概述