How enabling two settings tripled our scores on th

AI导读

在人工智能领域,衡量模型推理能力的基准测试正变得越来越复杂,而ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence,通用人工智能抽象与推理语料库)无疑是其中最具挑战性的标杆之一。近日,一项关于GPT-5.6在ARC-AGI-3测试中取得突破性进展的消息引发了业界的广泛关注。令人惊讶的是,这一性能提升并非源自模型架构的根本性变革,而是通过两个看似简单的API(应用程序编程接口)设置调整实现的。这一发现不仅揭示了当前大语言模型(LLM)尚未被充分利用的潜力,也为未来AI系统的优化路径提供了全新...

AI Prism 智棱 - 大模型 分类封面图

在人工智能领域,衡量模型推理能力的基准测试正变得越来越复杂,而ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence,通用人工智能抽象与推理语料库)无疑是其中最具挑战性的标杆之一。近日,一项关于GPT-5.6在ARC-AGI-3测试中取得突破性进展的消息引发了业界的广泛关注。令人惊讶的是,这一性能提升并非源自模型架构的根本性变革,而是通过两个看似简单的API(应用程序编程接口)设置调整实现的。这一发现不仅揭示了当前大语言模型(LLM)尚未被充分利用的潜力,也为未来AI系统的优化路径提供了全新的思考方向。

ARC-AGI测试旨在评估AI系统在解决从未见过的、需要抽象推理能力的视觉谜题时的表现。与依赖海量训练数据中记忆模式的传统自然语言处理任务不同,ARC-AGI要求模型具备类似人类的“举一反三”能力,即从极少数示例中归纳出规则并应用于新情境。正因如此,该测试被视为通往通用人工智能(AGI)道路上的一块关键试金石。此前,即便是最先进的模型,在ARC-AGI上的得分也往往徘徊在较低水平,其表现与人类儿童相比仍有显著差距。

GPT-5.5作为上一代旗舰模型,在ARC-AGI-2版本上的表现已经相当出色,但面对难度进一步提升的ARC-AGI-3时,依然显得力不从心。然而,研究人员在探索GPT-5.6的推理机制时发现,通过调整两个关键的API参数——即“推理保留”(Reasoning Retention)和“压缩模式”(Compaction Mode)——可以戏剧性地改变模型在测试中的表现。

所谓“推理保留”,是指模型在生成最终答案前,对中间推理步骤的保留程度。在默认设置下,GPT-5.6为了追求响应速度,可能会在生成过程中过早地“压缩”或丢弃部分中间推理链条。研究人员发现,当将“推理保留”参数调高时,模型会强制保留更多、更详细的推理步骤,从而在解决复杂逻辑谜题时拥有更充分的“思考时间”。这一调整直接提升了模型在需要多步推理的题目上的准确性。

而“压缩模式”则涉及模型如何将冗长的推理过程转化为简洁的最终输出。在默认模式下,模型倾向于将推理过程“压缩”成一个高度概括的结论,这有时会丢失关键细节。通过启用一种更为精细的压缩算法,模型能够在保持输出简洁性的同时,确保推理链条中的关键信息不被遗漏。这种“有损压缩”向“无损压缩”的转变,使得模型在生成答案时能够更精确地匹配问题所要求的输出格式,从而减少了因格式错误而导致的失分。

实验数据显示,在同时启用这两个优化设置后,GPT-5.6在ARC-AGI-3上的综合得分提升了约15%,而计算资源的消耗仅增加了不到5%。这一“性价比”极高的提升,让研究人员感到既惊喜又困惑:为什么如此简单的调整,此前没有被发现?

业界分析人士指出,这一发现揭示了当前大模型开发中的一个普遍盲区:过度关注模型架构和训练数据,而忽视了推理阶段(Inference Phase)的精细调优。在传统的模型优化思路中,提升性能往往意味着扩大模型规模、增加训练数据或改进训练算法。但GPT-5.6的案例表明,在推理阶段,通过调整API参数来改变模型的行为模式,同样可以带来可观的收益。这类似于在赛车比赛中,不更换发动机,而是通过优化燃油喷射和变速箱逻辑来提升圈速。

从更宏观的行业背景来看,这一发现对于AI应用的落地具有深远意义。对于企业用户而言,调整API参数的成本远低于重新训练或部署一个更大的模型。这意味着,许多现有的AI应用可能只需要通过简单的配置更新,就能获得显著的性能提升。尤其是在需要高精度推理的领域,如代码生成、数学证明和科学分析,这种“推理保留”和“压缩模式”的优化策略可能具有极高的实用价值。

然而,也有专家提出了谨慎的警告。他们指出,高“推理保留”设置虽然能提升推理准确性,但也会显著增加模型的响应延迟和内存占用。在实时性要求极高的应用中(如自动驾驶或在线客服),这种权衡可能并不划算。此外,过度依赖“推理保留”可能导致模型产生更多“过度思考”的情况,即为了追求完美推理而陷入无意义的循环,反而降低了效率。

OpenAI官方尚未就这一发现发表正式评论,但据内部人士透露,该团队正在研究如何将这两个参数的最佳设置自动化,使其成为GPT-5.6默认行为的一部分。如果这一设想得以实现,未来的GPT模型将能够根据任务难度动态调整其推理深度,从而在性能与效率之间实现更优的平衡。

此次关于GPT-5.6的发现,不仅是一次技术上的突破,更是一次方法论上的启示。它提醒我们,在追逐更大、更强的模型时,不应忽视对现有模型潜力的深入挖掘。有时候,通往更高智能的钥匙,就藏在那些看似微不足道的参数设置之中。对于整个AI研究社区而言,这无疑是一个值得深思的课题。

内容声明

本文内容基于公开市场信息与媒体报道进行整理,部分观点来自社区讨论。如涉及事实性问题,欢迎通过 xurj005@163.com 与我们指正,我们将及时核实并更新。