0

0

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

王林

王林

发布时间:2024-06-27 22:00:32

|

1123人浏览过

|

来源于机器之心

转载


专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS
INDUS 以南天星座命名,是一套全面的大型语言模型,支持五个科学领域。(来源:NASA)

编辑 | kx

在大量数据上训练的大型语言模型 (LLM) 在自然语言理解和生成任务上表现出色。大多数流行的 LLM 使用 Wikipedia 等通用语料库进行训练,但词汇的分布变化导致特定领域的性能不佳。

受此启发,NASA 与 IBM 合作开发了 INDUS,这是一套全面的 LLM,专为地球科学、生物学、物理学、太阳物理学、行星科学和天体物理学领域量身定制,并使用从不同数据源的精选科学语料库进行训练。

INDUS 包含两类模型:编码器和句子 Transformer。编码器将自然语言文本转换为 LLM 可以处理的数字编码。INDUS 编码器在包含天体物理学、行星科学、地球科学、太阳物理学、生物和物理科学数据的 600 亿个 tokens 的语料库上进行训练。

相关研究以「INDUS: Effective and Efficient Language Models for Scientific Applications」为题,发布在 arXiv 预印平台。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

论文链接:https://arxiv.org/abs/2405.10725

在通用领域语料库上训练的 LLM 在自然语言处理 (NLP) 任务上表现出色。然而,先前的研究表明,使用特定领域语料库训练的 LLM 在专门任务上表现更好。

比如,有研究者已经开发了几个特定领域的 LLM,例如 SCIBERT、BIOBERT、MATBERT、BATTERYBERT 和 SCHOLARBERT,目的是提高领域内 NLP 任务的准确性。

INDUS:一套全面的 LLM

在该研究中,研究人员特别关注与地球、天体、太阳和太阳系内的行星相关的跨学科领域,例如物理学、地球科学、天体物理学、太阳物理学、行星科学和生物学。

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

图示:INDUS 模型概览。(来源:论文)

INDUS 是一组基于编码器的 LLM,专注于这些感兴趣的领域,用不同来源的精心策划的语料库进行训练。INDUS 中包含的 50,000 个词汇中有超过一半是用于训练的特定科学领域所独有的。INDUS 编码器模型对大约 2.68 亿个文本对(包括标题/摘要和问题/答案)上的句子 Transformer 模型进行微调。

具体而言:

1. 利用字节对编码算法,从精选的科学语料库中构建了定制的标记器 INDUSBPE。

2. 使用精选的科学语料库和 INDUSBPE 标记器预训练了多个仅编码器的 LLM。进一步通过使用对比学习目标对仅编码器模型进行微调来创建句子嵌入模型,以学习「通用」句子嵌入。使用知识提炼技术训练了这些模型的更小、更高效的版本。

3. 创建了三个新的科学基准数据集,CLIMATE-CHANGE NER(实体识别任务)、NASA-QA(提取问答任务)和 NASA-IR(检索任务),以进一步加速这一多学科领域的研究。

4. 通过实验结果,展示了模型在这些基准任务以及现有领域特定基准上的出色表现,超越了 RoBERTa 等通用模型以及 SCIBERT 等科学领域编码器。

比非领域特定 LLM 表现更好

通过为 INDUS 提供领域特定词汇,研究团队在生物医学任务基准、科学问答基准和地球科学实体识别测试中,比开放的、非领域特定 LLM 表现更好。

网易人工智能
网易人工智能

网易数帆多媒体智能生产力平台

下载

将 INDUS 模型与类似大小的开源模型 RoBERTaBASE、SCIBERT、MINILM 和 TINYBERT 进行了比较。

在自然语言理解任务上,在基础模型中,INDUSBASE 在微观/宏观平均值上明显优于通用 RoBERTa 模型,同时在生物领域特定的对应模型 SCIBERT 中也取得了竞争性的表现。

表:BLURB 的评估结果。(来源:论文)

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

BLURB 在气候变化 NER 任务上明显优于相应的基线模型,表明了对大型特定领域数据进行训练的有效性。

表:气候变化 NER 基准结果。(来源:论文)

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

在 NASA-QA(提取问答任务)中,使用相关的 SQuAD 对扩充训练集进行微调。所有模型都经过 15 epochs 的微调,结果观察到 INDUSBASE 的表现优于所有类似规模的模型,而 INDUSSMALL 的表现相对较强。

表:NASA-QA 基准结果。(来源:论文)

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

在检索任务中,在 NASA-IR 数据集和 BEIR 基准上评估了 INDUS 模型,该基准由 12 个涵盖各种领域的检索任务组成。

如下表所示,两个句子嵌入模型在 NASA-IR 任务上的表现都明显优于基线,同时在几个 BEIR 任务上仍保持良好的性能。

表:NASA-IR 和 BEIR 的评估结果。(来源:论文)

专为五大科学领域定制,NASA与IBM合作开大语言模型INDUS

研究人员还在单个 A100 GPU 上测量了 BEIR 自然问题集的 4,202 个测试查询中每个查询的平均检索时间。这个时间包括编码查询、语料库的时间以及检索相关文档的时间。值得注意的是,INDUS-RETRIEVERSMALL 在 NASA-IR 和 BEIR 上的表现都优于 INDUS-RETRIEVERBASE,同时速度快了约 4.6 倍。

IBM 研究员 Bishwaranjan Bhattacharjee 对整体方法进行了评论:「我们不仅拥有自定义词汇表,还拥有用于训练编码器模型的大型专业语料库和良好的训练策略,从而实现了卓越的性能。对于较小、较快的版本,我们使用神经架构搜索来获得模型架构,并使用知识提炼来对其进行训练,同时监督较大的模型。」

NASA 生物和物理科学 (BPS) 部门 Sylvain Costes 博士讨论了整合 INDUS 的好处:「将 INDUS 与开放科学数据存储库 (OSDR) 应用程序编程接口 (API) 集成使我们能够开发和试用聊天机器人,为浏览单个数据集提供更直观的搜索功能。我们目前正在探索改进 OSDR 内部策展数据系统的方法,利用 INDUS 来提高策展团队的工作效率并减少每天所需的手动工作量。」

参考内容:https://techxplore.com/news/2024-06-nasa-ibm-collaboration-indus-large.html

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
硬盘接口类型介绍
硬盘接口类型介绍

硬盘接口类型有IDE、SATA、SCSI、Fibre Channel、USB、eSATA、mSATA、PCIe等等。详细介绍:1、IDE接口是一种并行接口,主要用于连接硬盘和光驱等设备,它主要有两种类型:ATA和ATAPI,IDE接口已经逐渐被SATA接口;2、SATA接口是一种串行接口,相较于IDE接口,它具有更高的传输速度、更低的功耗和更小的体积;3、SCSI接口等等。

1157

2023.10.19

PHP接口编写教程
PHP接口编写教程

本专题整合了PHP接口编写教程,阅读专题下面的文章了解更多详细内容。

215

2025.10.17

php8.4实现接口限流的教程
php8.4实现接口限流的教程

PHP8.4本身不内置限流功能,需借助Redis(令牌桶)或Swoole(漏桶)实现;文件锁因I/O瓶颈、无跨机共享、秒级精度等缺陷不适用高并发场景。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1998

2025.12.29

java接口相关教程
java接口相关教程

本专题整合了java接口相关内容,阅读专题下面的文章了解更多详细内容。

22

2026.01.19

页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

415

2023.08.14

Python 自然语言处理(NLP)基础与实战
Python 自然语言处理(NLP)基础与实战

本专题系统讲解 Python 在自然语言处理(NLP)领域的基础方法与实战应用,涵盖文本预处理(分词、去停用词)、词性标注、命名实体识别、关键词提取、情感分析,以及常用 NLP 库(NLTK、spaCy)的核心用法。通过真实文本案例,帮助学习者掌握 使用 Python 进行文本分析与语言数据处理的完整流程,适用于内容分析、舆情监测与智能文本应用场景。

51

2026.01.27

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2140

2024.08.16

C++ 设计模式与软件架构
C++ 设计模式与软件架构

本专题深入讲解 C++ 中的常见设计模式与架构优化,包括单例模式、工厂模式、观察者模式、策略模式、命令模式等,结合实际案例展示如何在 C++ 项目中应用这些模式提升代码可维护性与扩展性。通过案例分析,帮助开发者掌握 如何运用设计模式构建高质量的软件架构,提升系统的灵活性与可扩展性。

8

2026.01.30

c++ 字符串格式化
c++ 字符串格式化

本专题整合了c++字符串格式化用法、输出技巧、实践等等内容,阅读专题下面的文章了解更多详细内容。

8

2026.01.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
麻省理工大佬Python课程
麻省理工大佬Python课程

共34课时 | 5.2万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1.0万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号