ai china

荀子模型的小小编辑任务:加上标点,保留原文

7 条来源 2 条一手来源 已翻译 2026年9月15号

正在加载阅读与收藏统计…
正文
荀子古籍大语言模型北京发布会的与会者。

2023 年 12 月 2 日,荀子模型发布会与古籍人工智能研讨会在北京举行,图为与会者。照片由课题组提供,中国社会科学网刊发。[7]

请语言模型给一段古文加上标点,听起来只是个小任务:标出停顿,划分句子,让文字更容易读懂。这些要求之下,还有一项必须履行的约定:原文的每一个字都要留下。

荀子是一系列面向古籍开发的中文语言模型,为这项任务提供了一个很有启发的案例。它希望帮助读者读懂艰深典籍,而相关标点实验也显示,阅读辅助很容易越过界限,变成用户未曾要求的文字改动。真正有用的进展,是让助手添加的内容与它收到的文献清楚分开。

学术工具承担的编辑工作

2023 年 12 月 2 日,南京农业大学王东波团队与中华书局旗下古联合作,在北京发布荀子模型。据校方介绍,训练语料超过 20 亿汉字,其中包括出自大型官修古籍丛书《四库全书》的材料。发布时公布的功能涵盖自动标点、翻译、索引编制和信息抽取。[1][7]

项目同时发布了基础模型 XunziALLM 和对话模型 XunziChat。研究者因此有了两种起点:在基础模型上适配专门任务,或直接让已有对话能力的系统完成任务。项目仓库记载了基于 Qwen、Baichuan2、ChatGLM3 等模型开发的版本。[2]

把编辑工作按步骤展开,就能看清各环节的职责。转录先把文献化为计算机可处理的字符;标点提出这些字应当如何组合;翻译再以另一种语言形式给出一种解读。如果把这些操作合成一段流畅的回答,出错的位置就更难查明。读者需要知道,机器究竟是认错了原文字形、断错了句,还是误解了断句后的句意。

先给出五种断法,再作选择

2024 年 5 月的 EvaHan 系统论文中,Shitu Huo 和 Wenhui Chen 使用 Xunzi-Qwen-7B 探索了两轮提示方法。他们先生成五份带标点的文本,再要求模型综合这些版本,选出较合适的结果。第一轮的 temperature(温度参数)设为 0.95,以增加输出的差异;第二轮设为 0.1。论文报告的运行环境为配备 24 GB 显存的 RTX 4090,使用 CUDA 12.1。[3]

Test A 上,他们的标点 F1 分数从评测提供的荀子对话基线模型的 61.06 提升至 64.17。F1 综合衡量两件事:系统给出的标点有多少是正确的,以及应有的标点有多少被找了出来。至于有多少篇文本已经达到发表要求,单凭 F1 分数无法得知。这项结果对应的是特定模型、测试集和提示流程,论文也未证实编辑工时能随之节省多少。[3]

多种输出的价值在这里显现:不同断法可以摆在一起比较,但同一个模型反复作答,与多位学者独立审读仍有区别。几份结果相互一致,也不足以确定疑难文句该如何断开。对编辑而言,如果各种有争议的断句位置在模型作出选择后仍然可见,这些备选版本就能提供更多帮助。

标点之外,原文的字去了哪里

组织者的评测综述进一步呈现了这个问题。EvaHan 的 Test A 选用了四种体裁的此前未公开文本,并评估了十一类标点。在提交的结果中,汉字差异比例通常约为 1–2%,最高达到 8%。模型在尝试为原文添加标点时,也增添或遗漏了汉字。这些数字描述的是本次评测的各项提交结果,无法据此确定荀子自身的错误率。[4]

多出一个标点和多出一个汉字,在编辑工作中是两件不同的事。逗号为给定文字提出一种划分方式,新增的汉字则改动了文字本身。如果可检索的版本默默接受了这两类改动,后来的读者就未必还能辨明哪些内容出自原文,哪些由模型添入。

评测综述还记录了引号、书名号配对不一致的情况。[4] 因而,完整保留原文字词之后,标点仍需另行审查。系统即使一个字也没改,仍会有把话语归错人、把书名范围划错的情形。字符层面的忠实是审读的首要条件,文意的判断还在后面。

在关键环节收窄模型的选择

另一项 EvaHan 参评系统 SPEADO 展示了软件如何落实这项要求。来自中国人民大学和上海蜜度科技的研究者针对 Xunzi-Qwen-7B 做了任务专项训练,并结合参考样例检索与输出约束来完成任务。[5]

其中一项关键限制直接作用于生成过程:模型下一步预测的字符,只能是原始输入中获准使用的字符,或标点符号。这就是约束解码,即在答案逐步生成时限制模型可作出的选择。原文保全由此有了生成流程内部的约束,忠实于原文的要求也从提示语进入了程序机制。[5]

完整的 SPEADO 系统在 Test A 上报告的标点 F1 分数为 75.24,同一荀子对话基线模型的分数为 61.06。实验使用 A100 GPU。这一提升对应的是整套方法,其中还包括微调、样例检索和投票;依据该论文,仍无法将全部增益单独归于输出约束。[5]

从实际编辑工作出发,这些研究给出的设计启示是:编辑界面应固定转录文本,将标点另存为标注;对原文字词的任何校改,都应单独列为明确的建议。这样,审读者就能接受一处停顿,同时避免无意中接受一个被改写的人名。这里讨论的是由研究推导出的设计方向,尚未涉及已部署的荀子编辑产品具有何种功能。

下一步进展该如何呈现

截至 2026 年 9 月 15 日查阅时,荀子官网已列出较新的 Qwen3 系列模型,并介绍了下一代模型的研发计划。官网也承认,模型在训练数据质量、泛化能力和系统性历史知识方面仍有不足。[6] 因此,2024 年的分数应继续归于当时的实验系统,新版本的表现还需单独评估。

就断句标点这项用途而言,下一次有说服力的展示,应跟随编辑完成整段文本的审读,记录审读耗时、剩余的标点错误,以及原文字符序列是否完整保留,并按体裁分别报告结果。这些问题需要完整的审读记录才能回答,单个精心打磨的样例所能说明的范围有限。

荀子的吸引力很容易理解:那些目前需要深厚专业积累才能处理的文本,有望向更多人敞开。能够长久发挥作用的阅读辅助工具,应当为自己的每一项处理留下清楚的记录。加上标点,保留原文,让读者看见诠释从何处开始。

来源

  1. 南京农业大学,荀子模型发布报道,2023 年 12 月 7 日;以中文一手报道介绍 12 月 2 日的活动及项目范围。

  2. 荀子开发团队,XunziALLM 项目仓库;介绍基础模型、对话模型及其与各模型系列的关系,访问日期:2026 年 9 月 15 日。

  3. Shitu Huo、Wenhui Chen,《基于荀子大语言模型的古汉语断句与标点》(Ancient Chinese Sentence Segmentation and Punctuation on Xunzi LLM),LT4HALA 2024,第 242–245 页;提示流程、硬件及表 3 中的 Test A 结果。

  4. Bin Li 等,《EvaHan2024 概览:首届古汉语断句与标点国际评测》(Overview of EvaHan2024: The First International Evaluation on Ancient Chinese Sentence Segmentation and Punctuation),LT4HALA 2024,第 229–236 页;评测设计、成对标点及汉字差异。

  5. Xia Tian、Yu Kai、Yu Qianrong、Peng Xinran,《SPEADO:借助样例增强与解码优化实现古汉语断句标点》(SPEADO: Segmentation and Punctuation for Ancient Chinese Texts via Example Augmentation and Decoding Optimization),LT4HALA 2024,第 256–260 页;第 3.3 节及表 3。

  6. 荀子项目,中文官方网站;模型目录、已承认的局限与研发计划,访问日期:2026 年 9 月 15 日。

  7. Zhixiao Zhao,《荀子古籍大语言模型发布会在京举行》,中国社会科学网,2023 年 12 月 18 日;活动一手报道,照片由课题组提供。

Previous RoboTwin 将桌面环境纳入机器人测试

Recommended In ai china

Matched by subject and format