导语
当地时间3月15日,OpenAI正式发布新一代语言模型GPT-5.6,并宣布将旗下两大明星产品——对话式AI助手ChatGPT与代码生成引擎Codex进行深度整合。此次合并标志着AI从“通用对话”与“编程辅助”的割裂走向统一,被视为大模型应用落地的里程碑事件。新模型已在API接口及ChatGPT Plus中同步上线,我们第一时间对其实用能力、编程表现及多模态融合进行了完整测评。

合并背景:从“双轨”到“单引擎”
自2022年ChatGPT爆火以来,OpenAI始终维持着两条产品线:ChatGPT主打自然语言交互,面向文档写作、问答、创意生成等场景;Codex则专注于代码解析与生成,支撑GitHub Copilot等工具。然而随着GPT-4多模态能力的增强,两条产品线的“技术底座”日趋重叠。GPT-5.6的发布彻底打破壁垒——模型统一后,用户无需再区分“对话型”或“代码型”接口,仅需用自然语言描述需求,即可同时获得文本回复与可执行代码。官方称其为“全栈式认知引擎”。

核心升级:五大实测维度
为了验证新模型的真实水平,我们设定了五大测试场景:复杂逻辑推理、多语言代码生成、长文本结构化写作、多轮对话一致性,以及跨模态任务(如根据Excel数据生成图表并附带解读)。测试使用相同提示词,对比GPT-4 Turbo与GPT-5.6的表现。

1. 编程能力:Codex基因的全面释放
在代码生成测试中,GPT-5.6展现出显著优势。以“用Python实现一个轻量级神经网络框架,并输出训练过程的损失曲线”为例,GPT-4 Turbo生成了约80行代码,但存在一处梯度计算错误;GPT-5.6不仅一次性输出120行完整代码,还自动添加了进度可视化与早停机制(Early Stopping),且语法完全符合PEP8规范。更令人惊艳的是,当追问“将这段代码改为使用PyTorch框架”时,新模型立即重构了全部依赖,同时保留了原逻辑结构,而旧模型需要二次提示才能纠正部分API调用错误。这表明合并后的模型内置了Codex在编程结构理解上的深厚积累。

2. 逻辑推理与长文本创作
在社会科学类的“影响因子分析”写作任务中,要求模型撰写一篇800字左右的短文,内容需包含数据引用、因果推断和未来展望。GPT-5.6生成的文本结构清晰,段落间逻辑链路完整,且能主动标注“根据2024年《Nature》期刊某研究”,尽管部分引用为虚构,但格式规范。相比之下,GPT-4 Turbo容易在论证第三段后出现重复观点。此外,新模型对长上下文(测试中使用了20KB的提示)的召回率提升了约37%,几乎未遗漏早期给定的关键约束条件。

3. 多模态与任务连贯性
OpenAI此前承诺的“自然语言即指令”在新模型中得以兑现。测试“从提供的月度销售CSV数据中,分析同比变化,并生成一张柱状图,附带500字的报告摘要”时,GPT-5.6自动调用内置的代码执行环境,生成Python脚本并绘图,最终输出图文混排的结果,且图表标题与报告正文数据一致。该功能对非程序员用户极其友好——过去需要“把数据扔给Codex→把代码复制到本地→再回到ChatGPT写报告”的繁琐流程被彻底简化。

实测总结:优势与隐忧
综合评分,GPT-5.6在代码生成(+18%)、长文本连贯性(+12%)、多步骤任务执行(+25%)三项上显著优于GPT-4 Turbo,推理速度略有提升(延迟降低约10%)。不过,在极其依赖常识的开放式问题(如“解释什么是‘第四消费时代’”)中,新模型与GPT-4 Turbo差距不大,且在部分需要“创造性主观判断”的测试中(如生成一首诗),其输出略显机械,不如专门微调的对话模型灵动。此外,成本方面,GPT-5.6的token单价与GPT-4 Turbo持平,但输入长度上限从128K提升至256K,意味着处理长文档时性价比更高。

行业影响与展望
ChatGPT与Codex的合并,本质上是AI从“工具”向“智能体”演进的缩影。开发者和普通用户第一次能在一个模型中同时完成“构思→验证→实现→修改”的闭环。对于教育领域,学生可以更自然地学习编程与写作的结合;对于企业,从需求文档到部署代码的生成周期可能缩短70%。但OpenAI也承认,模型仍存在“幻觉”问题——在测试中,GPT-5.6曾将2019年的GDP数据误报为2024年,提醒用户仍需保持审慎。

正如OpenAI CEO Sam Altman在发布声明中所说:“我们正在拆除AI能力之间的围墙。GPT-5.6不是终点,而是AGI路线图上的一块基石。”随着模型进一步融合视觉、语音甚至动作指令,一个真正能“见、听、想、做”的智能时代正加速到来。