OpenAI近日发布了GPT-5.6开发者指南,为开发者提供了优化模型使用效率的详细方案。该指南基于早期测试和生产实践总结而成,建议开发者分三步优化模型:首先在Sol、Terra和Luna三种模型中选择适合的版本,其次调整推理强度,最后优化智能体的运行框架。
在模型选择方面,OpenAI特别强调了成本效益的平衡。根据7月30日生效的新价格体系,Sol、Terra和Luna三种模型的输入token单价分别为5美元、2美元和0.20美元,输出token单价则分别为30美元、12美元和1.20美元。这意味着同一任务在不同模型上的成本差异可达25倍。指南建议开发者在迁移模型时,应先保持原有推理档位完成一轮测试,再将推理强度降低一级,以评估实际效果与成本的变化。
OpenAI通过BrowseComp检索测试展示了这种优化策略的实效性。测试结果显示,使用Extra High推理档位的GPT-5.6 Luna模型得分为84.04%,单次成本1.33美元;而GPT-5.5 Extra High模型虽然得分略高至84.36%,但成本却高达33.27美元。两者得分差距仅0.32个百分点,成本却相差约25倍。这一数据表明,在某些场景下,选择成本更低的模型并适当增加推理时间,可能比直接使用高端模型更具性价比。
指南还详细介绍了GPT-5.6的三项主要架构改进:持久化推理与原生压缩技术、原生多智能体支持以及程序化工具调用功能。这些改进使得模型在处理复杂任务时更加灵活高效。例如,在ARC-AGI-3测试中,Sol模型通过保留推理过程并压缩长任务的上下文,得分从13.3%提升至38.3%,同时输出token数量减少至标准框架的约六分之一。
程序化工具调用功能则针对需要处理大量数据的场景进行了优化。传统模式下,模型可能需要先阅读上百份文件,再从上下文中筛选有用信息;而现在,模型可以编写Java代码完成数据过滤、聚合和工具调用,仅将最终需要判断的结果返回给模型处理。多智能体架构则适用于可以明确拆分的并行任务,OpenAI建议通过调度规则限制不必要的子智能体调用,以进一步提高效率。
实际生产环境中的测试数据进一步验证了这些优化策略的有效性。软件公司Superconductor在Rails代码库测试中发现,GPT-5.6 Sol High模型虽然质量得分(约77%)略低于Fable 5(约83%),但完成任务的时间(5至6分钟)仅为后者的四分之一。基于这一结果,Superconductor选择将Sol High作为日常开发的主力模型,在可接受的质量差距范围内换取了显著的速度提升。
A-CODE-LLM的测试也得出类似结论:在10项软件开发任务中,GPT-5.6家族并未表现出"推理档位越高、成绩越好"的规律。在某些项目中,基础版的Luna模型得分甚至超过了更贵的Sol Pro模型。这些测试表明,模型选择正在从单纯的性能竞争转向资源调度优化——复杂且失败代价高的任务交给Sol模型处理,重复性高、可复核的工作则可以使用Terra或Luna模型,甚至通过普通代码完成。
对于开发团队而言,模型选择的决策依据不应仅限于API单价或基准测试分数,而需要综合考虑任务从开始到完成的全部成本。这包括模型运行轮数、工具调用次数、返工频率以及人工复核时间等多个因素。OpenAI建议开发团队可以先选择一个调用频繁或成本较高的任务,分别用现有配置和降档配置运行,通过对比成功率、总成本、耗时等指标,评估低成本模型是否将额外工作转移给了人工环节。