美东时间 8 月 12 日周三,马斯克旗下 SpaceXAI 正式发布新一代大模型 Grok 4.6。SpaceXAI 称,新模型相比 Grok 4.5 实现显著提升,重点强化长时间运行的智能体(Agent)、复杂编程、知识工作以及交互式和视觉任务能力。
此次发布最受关注的并非单纯的模型迭代,而是Grok 4.6 在 SpaceXAI 公布的多项前沿模型测试中已经跻身第一梯队,同时 API 起售价仅为 2 美元 / 百万输入 Token、6 美元 / 百万输出 Token。SpaceXAI 称,其定价约为其他前沿模型的一半;该模型上线首周在 Cursor 和 Grok Build 中还提供 2 倍包含用量。
SpaceXAI 公布的测试数据显示,Grok 4.6 在 Artificial Analysis Intelligence Index 中取得 61 分,与 OpenAI 前沿模型 GPT-5.6 Sol Max 持平;在 GDPVal-AA v2 中则取得 1753 Elo,超过 GPT-5.6 Sol Max 的 1728 分和 Anthropic 前沿模型 Claude Fable 5 的 1741 分。


Grok 4.6 此次升级的核心,不再只是回答问题,而是让模型能够持续完成需要多步骤执行的复杂任务。
SpaceXAI 表示,Grok 4.6 重点针对长时间运行的智能体进行训练,可以连续完成研究主题、分析信息、处理代码库,以及把一个模糊的产品想法转化为可运行的应用或工作成果。公司还称,新模型在更长的任务轨迹中开始表现出更多自主测试和验证能力,会在继续执行之前检查此前的工作。
在训练方面,Grok 4.6 经历了比 Grok 4.5 更长的补充训练,加入经过筛选的模型生成推理数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI 利用 Grok 4.5 生成覆盖不同推理强度、智能体框架以及 STEM、软件工程和知识工作的 SFT 轨迹,并进一步通过强化学习训练模型完成通用编程、知识工作、内核优化、网页开发和计算机辅助设计等任务。
SpaceXAI 特别强调,Grok 4.6 在把 " 想法 " 变成 " 产品 " 方面有所提升。对于一个具体的产品构想,模型可以先研究陌生领域、设计应用结构、实现核心交互,再根据反馈进行多轮迭代;在视觉和交互式项目中,新模型也能够更快形成较为完整的第一版成果。
低价策略直指开发者市场,首周 Cursor 等产品加倍放量
相比模型能力本身,Grok 4.6 的定价策略可能更加值得 AI 产业链关注。
SpaceXAI 公布的 API 价格从每百万输入 Token 2 美元、每百万输出 Token 6 美元起,另有速度更快、价格翻倍的版本。公司同时宣布,Grok 4.6 已经接入 Cursor、Grok Build,并通过 OpenRouter、Vercel 和 Cloudflare 等合作伙伴提供。
作为对比,SpaceXAI 在公告中将 Grok 4.6 定位为 " 其他前沿模型的一半价格 "。而投资机构 Atreides Management 首席投资官 Gavin Baker 的评价更为激进:他认为,Grok 4.6 的性能大致相当于 Fable 5 Max,但输入 Token 价格低 80%、输出 Token 价格低 88%,因此在性能与成本的组合上具有明显优势。
科技业分析师、Superintelligence Newsletter 主编 Kim Monnis 也指出,Grok 4.6 不仅比 Opus 5 和 GPT-5.6 Sol 便宜,甚至低于 Sonnet 5,同时性能至少处于顶级模型水平。在他看来,这种 " 前沿性能 + 低成本 " 的组合才是 Grok 真正的护城河。
需要指出的是,API 单价并不能完全等同于实际使用成本。不同模型的 Token 消耗、推理强度和任务完成路径存在差异,因此 " 便宜一半 " 主要是对公布 API 价格的比较,而不是意味着所有具体任务的最终成本都恰好低 50%。
首周促销也进一步强化了这一低价策略:SpaceXAI 表示,Cursor 和 Grok Build 用户在首周可以获得 2 倍包含用量,让开发者可以低成本试用 Grok 4.6。
强化长程执行能力,模型可自主测试并持续修正
从测试结果看,Grok 4.6 的提升尤其集中在智能体执行真实工作这一正在成为 AI 模型竞争核心的领域。
SpaceXAI 重点展示了 Artificial Analysis 推出的 GDPVal-AA v2。该测试基于 OpenAI 的 GDPval 数据集,考察模型在真实世界、具有经济价值的专业任务中的表现,覆盖 44 个职业和 9 个主要行业;模型需要在智能体环境中使用 Shell 和网页浏览等工具完成任务,并通过盲测两两比较最终产出的文件,由此形成 Elo 评分。
在 SpaceXAI 此次公布的对比数据中,Grok 4.6 在 GDPVal-AA v2 取得 1753 Elo,排名高于 GPT-5.6 Sol Max 的 1728 分和 Claude Fable 5 Max 的 1741 分,较上一代 Grok 4.5 High 的 1526 分大幅提高。
与此同时,Grok 4.6 在 Artificial Analysis Intelligence Index 中获得 61 分,与 GPT-5.6 Sol Max 持平;该指数是由 9 项测试综合而成,用于衡量模型在数学、科学、编程和推理等多个维度的综合能力。
在 SpaceXAI 公布的其他测试中,Grok 4.6 同样较上一代有明显进步:
CursorBench v3.2:69.9%,Grok 4.5 High 为 66.7%;
FrontierCode v1.1:61.3%,Grok 4.5 High 为 56.6%;
APEX-Agents:57.5%,Grok 4.5 High 为 47.1%;
APEX-SWE:56.4%,Grok 4.5 High 为 53.6%;
AA-Briefcase:1577 分,Grok 4.5 High 为 1313 分;
Harvey LAB:15.8%,Grok 4.5 High 为 12.9%。
但 Grok 4.6 并非在所有测试中都占据第一。例如在 DeepSWE 1.1 和 Terminal-Bench v3.0 中,SpaceXAI 公布的 GPT-5.6 Sol Max 成绩仍高于 Grok 4.6。因此,更准确的说法是,Grok 4.6 已经在多项智能体和知识工作测试中进入前沿模型第一梯队,而不是全面击败所有竞争对手。
值得注意的是,Artificial Analysis 的 GDPVal-AA v2 排行榜本身会随着模型新增和评测更新而变化,因此本文标题所称的 " 力压 " 特指 SpaceXAI 此次发布时公布的横向测试结果,而非宣称 Grok 4.6 在所有时间、所有评测体系中均排名第一。
从模型到生态,SpaceXAI 加速抢占 AI 开发入口
Grok 4.6 的发布还显示,SpaceXAI 正在把竞争从单纯的模型性能比拼,进一步延伸到开发者入口和应用生态。
目前 Grok 4.6 已经同时进入 Cursor、Grok Build 和 API,并接入 OpenRouter、Vercel、Cloudflare 等渠道。SpaceXAI 希望借助这些平台,让开发者可以直接把 Grok 4.6 嵌入编程、网页开发和智能体工作流,而不只是通过 Grok 聊天产品使用模型。
马斯克本人也在 X 上密集为新模型站台。他先是宣布 "Grok 4.6 is now out",随后转发有关 1753 Elo 排名的报道,并强调 Grok 4.6 在 GDPVal-AA v2 中取得第一;在另一条转发中,他列出了 Grok 4.6 在 AA-Briefcase、Harvey LAB、CursorBench、FrontierCode、APEX-Agents 和 APEX-SWE 等测试中的排名,最后评价称:"Grok 4.6 is a banger"。
而 Atreides Management 的 Gavin Baker 则进一步把市场注意力引向下一代产品。他预计,Grok 4.7 将是规模明显更大的模型,并可能将 Cursor 和 SpaceX 数据纳入预训练。这一说法目前属于投资人士的判断,并非 SpaceXAI 此次发布公告确认的产品路线。
如果 Grok 4.6 能够在保持前沿模型级别能力的同时持续维持较低的 Token 价格,那么其意义可能不仅是一代模型的性能升级,更可能成为AI 大模型价格战向智能体时代延伸的一个新信号:当不同厂商的模型能力差距逐渐缩小时,性能与推理成本之间的平衡,可能越来越成为开发者和企业选择模型的关键。