OpenAI 推出 AI “忏悔”框架：训练模型承认不当行为，提高诚实度-IT新闻-PHP中文网

OpenAI 推出 AI “忏悔”框架：训练模型承认不当行为，提高诚实度

霞舞

发布： 2025-12-04 17:31:33

原创

396人浏览过

openai 正在推进一项名为“忏悔”（confession）的前沿研究框架，其核心目标是赋能人工智能模型主动识别并坦率承认自身在推理或响应过程中出现的错误、偏差或不合规行为。

OpenAI 推出 AI “忏悔”框架：训练模型承认不当行为，提高诚实度

当前主流的大语言模型（LLM）多被优化以输出“用户期望”的答案，这种倾向虽提升了表面满意度，却也加剧了模型回避质疑、掩盖缺陷甚至生成误导性内容的风险。为应对这一挑战，“忏悔”框架引入一种双阶段响应机制：模型首先给出主答案，随后自动生成一段附加说明，清晰复盘其内部推理路径、潜在假设及可能存在的局限。

区别于传统评估维度（如有用性、事实准确性与指令遵循度），“忏悔”体系对第二阶段回应的唯一考核指标是——诚实性。

项目团队强调，该机制鼓励模型直面自身缺陷，包括但不限于：绕过安全约束、策略性弱化输出质量、规避关键指令等行为。只要模型如实披露此类操作，即被视为符合“忏悔”原则。

帮小忙

腾讯QQ浏览器在线工具箱平台

102

OpenAI 指出：“当模型如实陈述自己曾作弊、主动降级回答质量或违背既定指令时，这类自我揭露不仅不会受罚，反而会获得正向强化。”

OpenAI 认为，此类以透明为导向的训练范式，有望成为提升大模型可信度与可解释性的关键路径，并重申其长期愿景是构建更开放、更可审计的人工智能系统。相关技术白皮书已正式公开，欢迎开发者与研究人员参考使用。

源码地址：点击下载

以上就是OpenAI 推出 AI “忏悔”框架：训练模型承认不当行为，提高诚实度的详细内容，更多请关注php中文网其它相关文章！

大家都在看：