主 题:最严苛 AI 交互推理测试:OpenAI 两项改进让 GPT-5.6 Sol 提分 188%
发 布 者:bakohok
标签分类: 日常
时 间:2026-08-01 08:25:20
内容预览:7 月 31 日消息,OpenAI 公司今天(7 月 31 日)发布公告,宣布通过改进框架,让 GPT-5.6 Sol 模型的 ARC-AGI-3 提高了 188%。ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能(AGI)最严苛、最顶尖的交互式推理评测基准。该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。OpenAI 公司在复盘后发现,GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制:第一,每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。第二,官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。针对上述问题,OpenAI 提出了推理保留(inference preservation)和上下文压缩(context compression)两个解决方案。推理保留方面,OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架,对于 GPT-5.6,只需传入前一次 response ID,即可在工具调用和多轮交互中自动保留推理。【评】:奥特曼牛逼了啊,看着sol强无敌,能干过肥波吗?
直达链接: https://www.nodeseek.com/post-851521-1
发 布 者:bakohok
标签分类: 日常
时 间:2026-08-01 08:25:20
内容预览:7 月 31 日消息,OpenAI 公司今天(7 月 31 日)发布公告,宣布通过改进框架,让 GPT-5.6 Sol 模型的 ARC-AGI-3 提高了 188%。ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试,是目前全球公认衡量 AI 通用智能(AGI)最严苛、最顶尖的交互式推理评测基准。该基准完全打破了传统 AI“做题”和知识问答的静态测试模式,将 AI 直接扔进一个完全陌生的“游戏环境”中,来评估其是否具备像人类一样的实时探索、学习与自适应能力。OpenAI 公司在复盘后发现,GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制:第一,每次游戏动作后,私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后,都需要重新理解游戏。模型仍可看到过去动作记录和简短备注,但看不到促成这些动作的计划、洞察和思考过程。第二,官方框架采用滚动截断窗口。随着历史变长,较早动作会从上下文中消失。也就是说,GPT-5.6 Sol 不仅无法保留过去思考,也会丢失过去动作记忆。针对上述问题,OpenAI 提出了推理保留(inference preservation)和上下文压缩(context compression)两个解决方案。推理保留方面,OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架,对于 GPT-5.6,只需传入前一次 response ID,即可在工具调用和多轮交互中自动保留推理。【评】:奥特曼牛逼了啊,看着sol强无敌,能干过肥波吗?
直达链接: https://www.nodeseek.com/post-851521-1