0

0

小模型训练效率狂飙 100 倍,Thinking Machine 推“在线策略蒸馏”

DDD

DDD

发布时间:2025-10-28 18:31:23

|

365人浏览过

|

来源于php中文网

原创

ai 新锐团队 thinking machine 近日推出一项革命性训练技术——在线策略蒸馏(on-policy distillation),成功将小规模模型在特定任务上的训练效率提升 50 至 100 倍,引发业界广泛关注。

长期以来,AI 模型训练始终困于两难境地:强化学习依赖试错探索,具备高度灵活性,但训练周期长、资源消耗大;而监督微调虽能快速收敛,却因依赖固定标注数据而缺乏适应性。如今,在线策略蒸馏为这一难题提供了全新解法——它如同为“学生模型”配备了一位强大的“实时导师”:在学生模型自主生成输出的过程中,一个高性能的教师模型同步对其每一步决策进行评估与反馈,通过最小化两者策略间的 KL 散度,实现高效且稳定的知识传递。

小模型训练效率狂飙 100 倍,Thinking Machine 推“在线策略蒸馏”

与传统知识蒸馏仅模仿最终结果不同,该方法强调对决策过程的动态模仿,有效避免了“死记硬背”或“投机取巧”的行为,显著增强了模型的泛化能力与行为一致性。

在数学推理任务测试中,研究团队仅使用原有强化学习所需训练步数的 1/7 到 1/10,便让一个 8B 参数的小模型达到了接近 32B 大模型的性能水平,整体计算开销下降达 两个数量级。这意味着,即使是没有海量算力支持的中小企业或学术团队,也能以极低成本训练出具备专业能力的高性能模型。

萝卜简历
萝卜简历

免费在线AI简历制作工具,帮助求职者轻松完成简历制作。

下载

尤为关键的是,该方法有效缓解了实际应用中的“灾难性遗忘”问题。在一次企业智能助理的实验中,模型在学习全新业务规则的同时,完整保留了原有的对话理解与工具调用功能,展现出强大的持续学习潜力,为构建可长期迭代的行业 AI 系统开辟了新路径。

此项研究由 Kevin Lu 牵头,他曾任职于 OpenAI 并主导多个核心大模型项目,现作为 Thinking Machine 的核心成员,致力于推动高效、轻量化的模型训练范式。团队坚信,随着 AI 技术向垂直场景深化,“小而专”的定制化模型将成为商业落地的主流方向,而在线策略蒸馏正是推动这一趋势的核心驱动力。

相关专题

更多
github中文官网入口 github中文版官网网页进入
github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started,GitHub 是一种基于云的平台,可在其中存储、共享并与他人一起编写代码。 通过将代码存储在GitHub 上的“存储库”中,你可以: “展示或共享”你的工作。 持续“跟踪和管理”对代码的更改。

1

2026.01.21

windows安全中心怎么关闭打开_windows安全中心操作指南
windows安全中心怎么关闭打开_windows安全中心操作指南

Windows安全中心可以通过系统设置轻松开关。 暂时关闭:打开“设置” -> “隐私和安全性” -> “Windows安全中心” -> “病毒和威胁防护” -> “管理设置”,将“实时保护”关闭。打开:同样路径将开关开启即可。如需彻底关闭,需在组策略(gpedit.msc)或注册表中禁用Windows Defender。

0

2026.01.21

C++游戏开发Unreal Engine_C++怎么用Unreal Engine开发游戏
C++游戏开发Unreal Engine_C++怎么用Unreal Engine开发游戏

虚幻引擎(Unreal Engine, 简称UE)是由Epic Games开发的一款功能强大的工业级3D游戏引擎,以高品质实时渲染(如Nanite和Lumen)闻名 。它基于C++语言,为开发者提供高效率的框架、强大的可视化脚本系统(蓝图)、以及针对PC、主机和移动端的完整开发工具,广泛用于游戏、电影制片等领域。

0

2026.01.21

Python GraphQL API 开发实战
Python GraphQL API 开发实战

本专题系统讲解 Python 在 GraphQL API 开发中的实际应用,涵盖 GraphQL 基础概念、Schema 设计、Query 与 Mutation 实现、权限控制、分页与性能优化,以及与现有 REST 服务和数据库的整合方式。通过完整示例,帮助学习者掌握 使用 Python 构建高扩展性、前后端协作友好的 GraphQL 接口服务,适用于中大型应用与复杂数据查询场景。

1

2026.01.21

云朵浏览器入口合集
云朵浏览器入口合集

本专题整合了云朵浏览器入口合集,阅读专题下面的文章了解更多详细地址。

22

2026.01.20

Java JVM 原理与性能调优实战
Java JVM 原理与性能调优实战

本专题系统讲解 Java 虚拟机(JVM)的核心工作原理与性能调优方法,包括 JVM 内存结构、对象创建与回收流程、垃圾回收器(Serial、CMS、G1、ZGC)对比分析、常见内存泄漏与性能瓶颈排查,以及 JVM 参数调优与监控工具(jstat、jmap、jvisualvm)的实战使用。通过真实案例,帮助学习者掌握 Java 应用在生产环境中的性能分析与优化能力。

29

2026.01.20

PS使用蒙版相关教程
PS使用蒙版相关教程

本专题整合了ps使用蒙版相关教程,阅读专题下面的文章了解更多详细内容。

175

2026.01.19

java用途介绍
java用途介绍

本专题整合了java用途功能相关介绍,阅读专题下面的文章了解更多详细内容。

125

2026.01.19

java输出数组相关教程
java输出数组相关教程

本专题整合了java输出数组相关教程,阅读专题下面的文章了解更多详细内容。

41

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.9万人学习

Pandas 教程
Pandas 教程

共15课时 | 0.9万人学习

ASP 教程
ASP 教程

共34课时 | 3.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号