“哥布林”词频暴涨 175%，OpenAI 复盘称 AI 训练奖励机制意外“跑偏”-网络资讯-红帽SEO工作室

当前位置：红帽SEO工作室网络资讯 “哥布林”词频暴涨 175%，OpenAI 复盘称 AI 训练奖励机制意外“跑偏”

→ 源码教程下载地址见 →右侧下载链接 →点“登录购买”→注册登录购买后可见→
→ 这里没有广告，只有干货！给力项目更多教程，点此加入VIP会员,即可免费下载！
→ 每日分享你意想不到的网络思维！加入红帽VIP会员，感受一下网络赚钱的快感，点击进入了解。

4 月 30 日消息，OpenAI 昨日（4 月 29 日）发布博文，复盘发现 GPT-5.1 系列及后续 AI 模型出现异常行为，在回答中频繁使用“哥布林”（goblin）和“小魔怪”（gremlin）等生物隐喻。

OpenAI 官方调查后发现，自从 GPT-5.1 系列发布以来，“哥布林”一词使用率上升 175%，“小魔怪”上升 52%。这一现象并非偶发，而是模型行为被特定奖励信号塑造的结果。

调查溯源发现，异常源于“书呆子”人格定制功能的训练过程。该功能仅占 ChatGPT 总回复量的 2.5%，却贡献了 66.7% 的“哥布林”提及量。

审计显示，原本用于鼓励该人格风格的奖励模型，在 76.2% 的数据集中对包含生物词汇的输出给予了更高评分。

技术团队发现，这种行为具有跨场景泛化能力。尽管奖励仅在“书呆子”条件下应用，但强化学习无法保证限制习得行为。

随着含生物词汇的输出被用于后续监督微调，模型形成了“奖励-生成-训练”的正反馈循环，导致该行为扩散至其他场景。附上相关图表如下：

OpenAI 针对此问题，已采取多项措施。技术团队移除了偏好生物词汇的奖励信号，并从训练数据中过滤了包含相关词汇的内容。受限于训练周期，GPT-5.5 未能完全规避此问题，开发团队通过添加指令提示进行了缓解。

相关阅读：

参考

温馨提示：
1、如非特别声明，本内容转载于网络，版权归原作者所有！
2、本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
3、本内容若侵犯到你的版权利益，请联系我们，会尽快给予删除处理！
我要投诉
红帽SEO工作室 » “哥布林”词频暴涨 175%，OpenAI 复盘称 AI 训练奖励机制意外“跑偏”

分享到：