HRM-Text 开源,层级递归 1B 参数仅需约 $1,500 预训练

Sapient Intelligence(新加坡)与麻省理工学院合作者于 5 月 20 日发布 HRM-Text 论文,并同步在 GitHub 和 HuggingFace 开源模型权重与完整训练框架。HRM-Text 基于"层级推理模型"(HRM)架构,以双时间尺度递归设计取代标准 Transformer 的单次前向传播:高层模块负责慢速抽象规划,低层模块处理快速细粒度计算,二者在连续潜空间中完成嵌套递归后方才输出,相当于以固定参数量实现近乎无限的计算深度。1B 参数的 XL 版在约 40B 有效 token 上训练约 46 小时(双节点 16 张 H100,成本约 1,472 美元),达到 MMLU 60.7%、GSM8K 84.5%、ARC-Challenge 81.9%、MATH 56.2%;0.6B 参数的 L(TRM)变体约 800 美元完成训练,且在多项下游基准上超越以标准 Transformer 训练的 3B 量级模型。

训练数据方面,HRM-Text 仅使用约 40B 个结构化 token,是当前主流预训练运行(4T 至 36T token)的 1/100 至 1/1000,计算量节省 130 至 600 倍、数据量节省 150 至 900 倍。开源内容包含数据提取、PrefixLM 序列打包、PyTorch FSDP2 分布式训练、FlashAttention 3 内核及检查点转换工具,目前仅支持 Hopper 架构 GPU(H100/H800)。需注意,现有权重为纯预训练版本,尚未经过指令微调或 RLHF 对齐,仅支持前缀续写;量化至 int4 后模型大小约 0.6 GiB,可在本地运行。发布方将此次开源定位为"基础模型预训练民主化"的实证——此前受限于算力成本,从头预训练通常只有头部实验室才能承担。

GitHub | HuggingFace | PRNewswire