阿里千问发布 Qwen3.7-Max,智能体旗舰,自主执行 35 小时

阿里巴巴千问团队发布面向智能体时代的新旗舰模型 Qwen3.7-Max,即将通过阿里云百炼 API 上线。模型核心定位为"全能智能体基座",覆盖编程(从前端原型到复杂多文件工程)、办公生产力(MCP 集成与多智能体协作工作流)与长周期自主执行三大场景。基准测试方面,在 SWE-Verified(80.4)上与 Claude Opus 4.6(80.8)及 DeepSeek V4 Pro(80.6)基本持平,在 GPQA Diamond(92.4 vs. Opus-4.6 的 91.3)、Terminal Bench 2.0-Terminus(69.7 vs. DS-V4-Pro 的 67.9)、MCP-Atlas(76.4 vs. Opus-4.6 的 75.8)等任务型基准上超越两者。团队强调,上述评测结果来自包括 Claude Code、OpenClaw、Qwen Code 在内的多种框架,而非针对单一框架优化,体现真正的跨框架泛化能力。

团队以三个实战案例验证长程自主能力。最具代表性的是针对 SGLang Extend Attention 算子的内核优化:在从未见过的平头哥真武 M890 PPU 硬件平台上,Qwen3.7-Max 约 35 小时内执行 1,158 次工具调用、完成 432 次内核评估,最终实现相对 Triton 参考实现几何平均 10.0 倍加速——同等条件下 GLM 5.1 为 7.3 倍、Kimi K2.6 为 5.0 倍、DeepSeek V4 Pro 为 3.3 倍、Qwen3.6-Plus 为 1.1 倍。第二个案例中,模型监控逾 80 小时强化学习训练,自主生成 13 条启发式规则,识别出 1,618 个奖励作弊案例;模拟创业公司运营的 YC-Bench 中年营收达 208 万美元,是上代 Qwen3.6-Plus(105 万美元)的近两倍。技术层面,团队将训练实例解耦为任务、运行框架与验证器三个正交组件,通过跨框架强化学习训练迫使模型学习具备泛化能力的解题策略,而非记忆特定框架操作捷径。

千问官方微信公众号