智东西 10 月 10 日报道,一项来自 MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究发现:只要把基础模型回答的开头固定为特定 Token 序列,模型的数学推理成绩就能接近甚至超过对应的强化学习版本。以 Ai2 基础模型 Olmo-3-7B 为例,将回答固定为特定开头后,其在 MATH-500 上的准确率从 42% 升至 78%,超过强化学习版本的 75%——全程没有修改模型参数,也没有增加解题示例。
研究的线索来自一个反常观察:正确答案中约半数以同样的句号加换行开头,错误答案中这一比例只有 14%。论文已于 10 月 5 日提交,研究者认为,基础模型答错有时并非不会做,而是没有进入解题状态;强化学习的部分作用,可能正是让模型更容易选到这种有效的回答起点。
【AICOR 点评】这类发现的价值不在刷分技巧,而在揭示一个朴素的工程真相:模型能力的发挥高度依赖调用方式。对企业来说,提示词设计、输出引导这些「软工程」往往比更换更强的模型性价比更高。在追逐更大模型之前,把已有模型的调用姿势调对,可能就释放了大量沉睡能力。
Aviso de Copyright Este artículo está asistido por IA, reescrito a partir de reportajes públicos. El copyright de la información pertenece a los autores y medios originales; el contenido es solo para compartir información del sector y no constituye asesoramiento de inversión ni comercial.
Por cuestiones de copyright, contacte a AICOR (400-601-8080 / WeChat: aicor-ai); lo gestionaremos con prontitud al recibir la notificación.