首页 > 新闻 > IT新闻 > 正文

OpenAI 推出 AI “忏悔”框架:训练模型承认不当行为,提高诚实度

霞舞
发布: 2025-12-04 17:31:33
原创
396人浏览过

openai 正在推进一项名为“忏悔”(confession)的前沿研究框架,其核心目标是赋能人工智能模型主动识别并坦率承认自身在推理或响应过程中出现的错误、偏差或不合规行为。

OpenAI 推出 AI “忏悔”框架:训练模型承认不当行为,提高诚实度

当前主流的大语言模型(LLM)多被优化以输出“用户期望”的答案,这种倾向虽提升了表面满意度,却也加剧了模型回避质疑、掩盖缺陷甚至生成误导性内容的风险。为应对这一挑战,“忏悔”框架引入一种双阶段响应机制:模型首先给出主答案,随后自动生成一段附加说明,清晰复盘其内部推理路径、潜在假设及可能存在的局限。

区别于传统评估维度(如有用性、事实准确性与指令遵循度),“忏悔”体系对第二阶段回应的唯一考核指标是——诚实性。

项目团队强调,该机制鼓励模型直面自身缺陷,包括但不限于:绕过安全约束、策略性弱化输出质量、规避关键指令等行为。只要模型如实披露此类操作,即被视为符合“忏悔”原则。

帮小忙
帮小忙

腾讯QQ浏览器在线工具箱平台

帮小忙 102
查看详情 帮小忙

OpenAI 指出:“当模型如实陈述自己曾作弊、主动降级回答质量或违背既定指令时,这类自我揭露不仅不会受罚,反而会获得正向强化。”

OpenAI 认为,此类以透明为导向的训练范式,有望成为提升大模型可信度与可解释性的关键路径,并重申其长期愿景是构建更开放、更可审计的人工智能系统。相关技术白皮书已正式公开,欢迎开发者与研究人员参考使用。

源码地址:点击下载

以上就是OpenAI 推出 AI “忏悔”框架:训练模型承认不当行为,提高诚实度的详细内容,更多请关注php中文网其它相关文章!

最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号