这个模式我在 LinkedIn 上前几天写过 其实是一个真正追求产品质量的团队最终必然要实现的一种模式 (我原创的名词:叫做 shadow steering )
它是这样的:
平时一个普通的模型工作。另一个更聪明的模型在后台并不需要做什么 甚至无需输出 只要输入 (输入成本极其便宜)来维护一个 prefill kv.
到了某个时刻 harness 侦测到小模型质量下降干不下去的时候,大模型介入 输出一百个 token 的指导 小模型被点悟 一点即通 继续干活
这个 “影子点拨”可以藏在小模型的思考轨迹里 反正用户看不见 这种直接在轨迹上的点拨比 off policy 不知道高到哪去了,因为可以在长程任务中期给一个 on-policy 的指点 后面拿来蒸馏非常舒服
这个模式可以用来节省大量中等模型成本,也可以用来蒸馏,用来测试,用来收集长程任务质量等等
回到这则新闻本身。我看到的是它只能说明一件事情,DeepSeek 下一代模型已经训练完毕,在影子测试而已 智能程度让用户感知到了 Fable 5 而已。