SpaceXAI于8月12日正式发布了全新升级的旗舰级AI模型Grok 4.6。该模型专为处理复杂、长程的Agent任务打造,并在多项基准测试中展现出媲美甚至超越OpenAI旗舰模型GPT-5.6 Sol的强劲实力。
t &XH:w&j
X-&t!0O4}` 此前在7月份,SpaceXAI曾联合Cursor推出Grok 4.5模型。该模型在数万张NVIDIA GB300 GPU的算力支持下完成训练,性能仅次于Anthropic的Fable 5和OpenAI的GPT-5.6 Sol,且具备极高的性价比。而本次推出的Grok 4.6在此基础上实现了进一步飞跃,训练过程重点针对长程复杂任务进行了优化,采用了精选的模型生成数据,涵盖推理能力、高级技术概念以及高质量工程代码。此外,模型还接受了包括知识工作、通用编程及多个领域专属环境在内的广泛Agent强化学习训练,这使其在构建视觉和交互式应用时能够提供更优秀的初始效果。
E/z^~;KA yk OJhd3 根据Artificial Analysis涵盖九项热门AI基准测试的综合指数显示,Grok 4.6的成绩已追平GPT-5.6 Sol,仅落后于Claude Opus 5与Fable 5 Max。在评估逻辑与知识水平的GDPval-AA v2测试中,Grok 4.6取得了1753的Elo得分;而在衡量长时程知识工作Agent任务的私有基准测试AA-Briefcase中,其Elo得分也达到了1577分,两项表现均仅次于Claude Opus 5。
]Tk3@jw+b 7WK^eW"y8 在性能显著提升的同时,Grok 4.6依然保持了极具竞争力的速度与价格体系。该模型的运行速度为80 TPS,基础版本的输入与输出价格分别为每百万Token 2美元和6美元,高速变体版则为每百万Token 4美元和12美元。目前,Cursor与Grok Build用户已可直接体验该模型,开发者也可通过API进行接入。为庆祝新模型上线,SpaceXAI还面向Grok Build与Cursor用户推出了限时优惠活动,首周内可享受双倍使用额度。
7 wS)'zR;
yx?Z&9z <