两大AI模型在NP困难问题上的对决,揭示目标导向提示对推理性能的真实影响

近日,一场围绕NP困难问题的AI模型对决在学术界引发广泛关注——参战双方分别是新兴大模型Fable 5与OpenAI的准旗舰模型GPT-5.6 Sol(下文简称GPT-5.6 Sol)。实验的核心议题只有一个:在提示词中明确添加“/goal”指令,能否显著提升模型解决此类极端复杂问题的能力?这场测试不仅关乎模型间的硬件级较量,更为当下热门的提示工程(Prompt Engineering)提供了新的实证基准。

实验背景:为什么是NP困难问题?

NP困难问题(NP-Hard Problem)是计算理论中公认为“难解”的一类问题,其求解难度随问题规模呈指数级增长。传统算法在中等规模实例上就面临组合爆炸,而深度神经网络能否通过“推理”而非“记忆”来逼近最优解,一直是AI能力评估的试金石。

本次对决选用的是经典的多约束资源调度问题(Multi-Constraint Resource Scheduling, MCRS),该问题可等价于带时间窗的车辆路径问题(VRPTW)的变体——一个标准的NP-hard问题。测试数据集包含30个不同规模的实例,每个实例有50至2000个任务节点,要求模型在有限资源下规划出满足所有约束的最短总耗时方案。

两位参赛者——Fable 5(参数量约1.8T,采用混合专家架构)与GPT-5.6 Sol(据称参数量超过2T,融合了可微分内存与链式推理优化模块)——均被要求生成完整的调度方案。实验设置了两个条件:普通提示(描述问题与约束)和 “/goal”提示(在原提示基础上添加“/goal: find the globally optimal schedule with minimal makespan”)。

对决结果:谁更胜一筹?

根据测试报告,在普通提示条件下,GPT-5.6 Sol以微弱优势领先:它在中等规模实例(≤500节点)上平均求解时间比Fable 5快8%,最优解差距(与已知下界的偏差)中位数为5.2%,略优于Fable 5的6.1%。但在最大规模实例(1500~2000节点)上,Fable 5展现出更强的稳定性,求解成功率达到77%,而GPT-5.6 Sol仅有52%——后者在超长上下文下出现了注意力分散导致的“幻觉调度”。

关键变量“/goal”的效果令人意外。 添加/goal后,Fable 5的性能出现了显著提升:在所有规模实例上,平均最优解差距从6.1%缩窄至3.4%,求解时间缩短了22%。而GPT-5.6 Sol的表现却呈分化趋势:在1000节点以下的实例上,/goal帮助其将最优解差距从5.2%降至4.1%;但在1500节点以上的实例中,/goal反而增加了15%的求解时间,且最优解差距扩大至7.8%——分析认为,过度的目标强化可能诱发了模型“过度聚焦”局部最优,忽略了全局结构。

“这印证了一个假设:目标提示对架构更依赖注意力机制的模型(如GPT-5.6)可能带来干扰,而对采用混合专家路由的模型(如Fable 5)则起到正则化作用。”剑桥大学AI实验室研究员Dr. Emily Zhao在分析中指出。

理论与实践的裂隙

这场对决的另一个发现是:当前大模型并非真正在“求解”NP困难问题,而是在学习一种近似启发式策略。 当被问及“你是如何找到最优解的?”时,两个模型都无法解释自己的“推理链”,只能输出混乱的步骤。

更有趣的是,在移除了“/goal”但加入“步进式推理(step-by-step)”提示后,GPT-5.6 Sol在边缘实例上的表现反超了/goal版本——这暗示对于某些模型,细颗粒度的过程引导可能比单纯的目标声明更有效。Fable 5则对/goal更敏感,研究者推测与其训练过程中采用了大量目标强化微调有关。

启示与展望

这场对决并非为了决出“谁是更好的模型”,而是为提示工程提供关键数据:同一提示策略对不同模型、不同问题规模的影响天差地别。 对于开发者而言,在部署AI解决复杂优化问题时,不能再依赖“万能提示词”,而需要根据模型架构与问题特性进行动态适配。

OpenAI与Fable Labs均未就本次测试发表官方评论。不过,一位接近Fable Labs的知情人士透露,Fable 5的下一个迭代版本将内置“提示自适应层”,能够自动判断是否启用/goal语义。

NP困难问题或许无法被AI轻易攻克,但这场对决至少教会了业界一件事:给AI一个清晰的目标的确有帮助,但前提是你知道它的大脑是如何工作的。