当你感觉模型降智了,模型厂商搞了什么鬼?
一个现象是,刚上线的模型往往很聪明,但一旦过了一段时间,可能是用户量变大,就开始“降智”。
评论区有个高赞、专业简短的回答,给了四种常见做法:
(让AI解释了下)
手段一:路由到小模型(最明显)
系统判断用户问题难度。"你好""写个请假条"这类简单请求,会被路由到极低成本的小模型上。
只有复杂代码调试、长文本推理等任务才真正调用旗舰模型。
问题在于:系统判断"简单"的标准不可见,你觉得需要深度思考的问题,可能被判定为"简单"而发给了便宜模型。
手段二:调低 juice 值,减少思考 token
Juice 值(社区俗称"果汁值")是 OpenAI 推理模型中一个隐藏参数,控制模型在回答前被允许思考多深。
正常满血版 gpt-5.5 xhigh 的 juice 约为 768,而被灰度到降配池的用户可能只有 128,缩水 6 倍。
思考预算少了,模型自然"想不深"。
参数官方没公开,是社区开发者从系统提示词中逆向提取出来的。
手段三:提前中断思考,强行回答
即使分配了思考预算,系统也可能在推理过程中提前截断,强制模型输出答案。
表现为:回答速度变快,但逻辑链条变短、缺少自我检查、容易在复杂问题上跳步或出错。
用户感知到的是"它好像没认真想就答了"。
手段四:MTP 增加小模型接受概率
Multi-Token Prediction(多 token 预测)机制下,系统会根据中间结果动态决定是否继续用大模型推理。
如果小模型的中间输出"看起来还行",系统就提高接受小模型结果的概率,提前终止大模型的深度推理。
在用户感知不到明显差异的边界上节省算力。