Grok 4.6 发布即登顶性价比榜:智能指数追平 GPT-5.6 Sol,定价却便宜 60% 以上
xAI 发布 Grok 4.6,以 61 分智能指数追平 GPT-5.6 Sol,逼近 Claude Opus 5,并在智能体与编码基准上大幅提升;定价较竞品低 60% 以上,长周期任务资源消耗不到 Claude Opus 5 的四分之一,性价比优势突出。
发布时间:2026/08/14 03:57|分类:人工智能
xAI 正式发布 Grok 4.6,在 AI 智能指数上获得 61 分,追平 GPT-5.6 Sol(Max),仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分),跻身全球前沿模型第一梯队。模型在 Grok 4.5 基础上扩展训练,核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,结合高质量工程数据和改进的优化器。训练方法关键变化在于数据闭环:Grok 4.5 被用于重新生成监督微调轨迹,涵盖推理、代理工具使用及 STEM、软件工程和知识工作等领域;并在代理强化学习任务上训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计。智能体基准方面,Grok 4.6 的 GDPval-AA v2 达 1753 Elo,仅次于 Claude Opus 5;DeepSWE v1.1 提升至 65.9%;APEX-Agents 从 47.1% 升至 57.5%;Terminal-Bench v3.0 从 15.7% 升至 26%;CursorBench v3.2 获 69.9%,FrontierCode v1.1 获 61.3%。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,比 Claude Opus 5 和 GPT-5.6 Sol 低 60% 以上。AA-Briefcase 长周期知识工作基准中,Grok 4.6 平均用 53 个回合和约 5 亿输入 token 完成任务,Claude Opus 5 需约 103 个回合和约 20 亿 token。模型已通过 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等渠道提供,上下文窗口 50 万 token。