0

0

什么是TEI(文本编码规范) 学术XML标准

畫卷琴夢

畫卷琴夢

发布时间:2025-12-18 15:40:02

|

414人浏览过

|

来源于php中文网

原创

TEI是一套面向人文学科的国际通行学术XML编码规范,以结构化语义标签整合文本与元数据,强制包含四大元数据区块,采用模块化设计并由P5 Schema严格约束,根元素为,分和两大部分,广泛应用于古籍整理、版本比对与数字出版。

什么是tei(文本编码规范) 学术xml标准

TEI(Text Encoding Initiative,文本编码倡议)不是一种工具或软件,而是一套面向人文学科的、国际通行的学术XML编码规范。它用结构化、语义明确的XML标签,把文本内容和元数据(如作者、年代、语言、版本、手稿状态等)一起打包保存,让古籍、信札、诗歌、词典等复杂文本既能被人读懂,也能被机器识别、检索、分析和长期存档。

它为什么是“学术XML标准”

因为TEI不是通用XML,而是专为学术研究定制的XML框架:

  • 所有标签都有明确定义的人文语义,比如表示手稿中无法辨认的文字,旧写法校正后记录校勘过程;
  • 强制包含四大元数据区块:fileDesc(文献描述)、encodingDesc(编码说明)、profileDesc(内容特征)、revisionDesc(修订日志),确保每份数字文本可溯源、可复现;
  • 采用模块化设计,支持按需组合——研究简牍可用“手稿描述模块”,编纂词典则启用“词典编码模块”,不强求全功能;
  • 所有标签定义由TEI联盟通过XML Schema(P5版)严格约束,任何TEI文件都可通过验证工具(如Trafilatura、Oxygen)自动校验是否合规。

它的基本结构长什么样

一个合法TEI文档必须以为根元素,内部严格分为两大部分:

  • :存放全部元数据,包括标题、作者、创建时间、语言标识(xml:lang)、关键词、编码依据等;
  • :承载正文内容,通常再细分为(前言/目录)、(主体)、(附录/索引),层级清晰,便于分段处理与多模态关联(如图文对照)。

例如,一段带异体字标注的古文可能这样编码:

Kodezi
Kodezi

Kodezi是一个代码助手,帮助完成代码生成、bug修复等。

下载

其字作,见于青木川叙事

它在真实学术场景中怎么用

TEI不是纸上标准,而是驱动实际项目的底层协议:

  • 哈佛《中国历代人物传记资料库》(CBDB)用TEI管理数万条人物生平与文献出处;
  • 牛津莎士比亚项目将早期四开本、对开本扫描件+校勘注释统一转为TEI,支撑版本比对与文本挖掘;
  • 秦汉简牍整理团队用等标签标记残缺与补字,实现考古信息与文本逻辑同步存档;
  • 学者用XSLT将TEI批量转成HTML供在线阅览,或转成LaTeX生成出版级PDF,全程无需人工重排版。

它和普通XML有什么不同

关键不在语法,而在意图和约束力:

  • 普通XML允许任意自定义标签,但缺乏语义共识,可能指人名、地名或书名;TEI中各司其职;
  • 普通XML不强制元数据,TEI要求teiHeader完整且结构化,否则无法通过验证;
  • 普通XML没有领域知识嵌入,TEI内置200+种文本类型模板(戏剧、日记、法律文书等),直接复用即可避免重复造轮子。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1923

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

2100

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

1117

2024.11.28

Docker容器化部署与DevOps实践
Docker容器化部署与DevOps实践

本专题面向后端与运维开发者,系统讲解 Docker 容器化技术在实际项目中的应用。内容涵盖 Docker 镜像构建、容器运行机制、Docker Compose 多服务编排,以及在 DevOps 流程中的持续集成与持续部署实践。通过真实场景演示,帮助开发者实现应用的快速部署、环境一致性与运维自动化。

0

2026.02.11

Rust异步编程与Tokio运行时实战
Rust异步编程与Tokio运行时实战

本专题聚焦 Rust 语言的异步编程模型,深入讲解 async/await 机制与 Tokio 运行时的核心原理。内容包括异步任务调度、Future 执行模型、并发安全、网络 IO 编程以及高并发场景下的性能优化。通过实战示例,帮助开发者使用 Rust 构建高性能、低延迟的后端服务与网络应用。

1

2026.02.11

Spring Boot企业级开发与MyBatis Plus实战
Spring Boot企业级开发与MyBatis Plus实战

本专题面向 Java 后端开发者,系统讲解如何基于 Spring Boot 与 MyBatis Plus 构建高效、规范的企业级应用。内容涵盖项目架构设计、数据访问层封装、通用 CRUD 实现、分页与条件查询、代码生成器以及常见性能优化方案。通过完整实战案例,帮助开发者提升后端开发效率,减少重复代码,快速交付稳定可维护的业务系统。

3

2026.02.11

包子漫画网页版入口与全集阅读指南_正版免费漫画快速访问方法
包子漫画网页版入口与全集阅读指南_正版免费漫画快速访问方法

本专题汇总了包子漫画官网和网页版入口,提供最新章节抢先看方法、正版免费阅读指南,以及稳定访问方式,帮助用户快速直达包子漫画页面,无广告畅享全集漫画内容。

137

2026.02.10

MC.JS网页版快速畅玩指南_MC.JS官网在线入口及免安装体验方法
MC.JS网页版快速畅玩指南_MC.JS官网在线入口及免安装体验方法

本专题汇总了MC.JS官网入口和网页版快速畅玩方法,提供免安装访问、不同版本(1.8.8、1.12.8)在线体验指南,以及正版网页端操作说明,帮助玩家轻松进入MC.JS世界,实现即时畅玩与高效体验。

80

2026.02.10

谷歌邮箱网页版登录与注册全指南_Gmail账号快速访问与安全操作教程
谷歌邮箱网页版登录与注册全指南_Gmail账号快速访问与安全操作教程

本专题汇总了谷歌邮箱网页版的最新登录入口和注册方法,详细提供官方账号快速访问方式、网页版操作教程及安全登录技巧,帮助用户轻松管理Gmail邮箱账户,实现高效、安全的邮箱使用体验。

65

2026.02.10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Bootstrap 5教程
Bootstrap 5教程

共46课时 | 3.3万人学习

AngularJS教程
AngularJS教程

共24课时 | 3.5万人学习

CSS教程
CSS教程

共754课时 | 30.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号