主 题:Grok 4.6 发布:Arena 前端开发榜第 5,Agent 成本更低
发 布 者:steve1996
标签分类: 日常
时 间:2026-08-14 10:01:20
内容预览:一、模型定位8月12日,xAI 发布 Grok 4.6,官方将其定位为面向编程、Agent 任务和知识工作的模型,重点提升长链路任务的持续工作能力。二、榜单表现8月13日,Grok 4.6 High 在 Arena 前端开发榜中以1630分排名第5,落后第一名 Claude Opus 5 Max 61分。需要注意,这是一项前端开发子榜,并非综合总榜。在 Artificial Analysis Intelligence Index 中,Grok 4.6 High 得分61,与 GPT-5.6 Sol Max 并列。Arena 更接近用户对开发结果的偏好,Artificial Analysis 则用于观察综合能力,两者不能直接比较。三、API 调用成本短上下文场景下,Grok 4.6 每100万输入 Token 收费2美元,缓存输入0.5美元,输出6美元。按100万输入加100万输出计算,总成本约为8美元,低于 GPT-5.6 Sol 的35美元和 Kimi K3 的18美元。如果请求超过20万上下文,将进入长上下文价格档,输入、缓存输入和输出价格分别为4美元、1美元和12美元。四、任务总成本Cost per Task 指完成一项完整任务的总成本,除了 Token 费用,还包括交互轮次、工具调用和重复尝试等消耗。一组围绕 AA-Briefcase 的运行统计显示,Grok 4.6 平均需要约53轮交互和0.5B Tokens,Claude Opus 5 Max 约需要103轮和2.0B Tokens。该结果只代表特定评测运行,不能视为所有 Agent 任务的普遍平均值。五、自我校验能力在长任务中,xAI 观察到 Grok 4.6 出现更多自我测试和验证行为。DeepSWE 得分从上一代的54%提升到65.9%,APEX-Agents 得分为57.5%。六、后续计划此前有消息称,
直达链接: https://www.nodeseek.com/post-873247-1
 
 
Back to Top