发布时间:2026/8/24 9:15:18
Jiayan分词核心原理详解:字符级HMM+kenlm语言模型如何实现无词典文言文分词 Jiayan分词核心原理详解字符级HMMkenlm语言模型如何实现无词典文言文分词【免费下载链接】Jiayan甲言专注于古代汉语(古汉语/古文/文言文/文言)处理的NLP工具包支持文言词库构建、分词、词性标注、断句和标点。Jiayan, the 1st NLP toolkit designed for Classical Chinese, supports lexicon construction, tokenizing, POS tagging, sentence segmentation and punctuation.项目地址: https://gitcode.com/gh_mirrors/ji/JiayanJiayan甲言是专注古代汉语文言文处理的NLP工具包。本文将拆解它最核心的能力——文言文分词在没有分词语料、没有现成词库的情况下如何用「字符级隐马尔可夫模型HMM kenlm 语言模型」把一句古文自动切成词并对比通用分词工具为何在文言文上失灵。一、通用分词工具为什么切不好文言文主流汉语 NLP 工具如 LTP、HanLP都是在现代汉语语料上训练的。古文与今汉语法差异大、词汇体系不同直接套用就会出现明显切偏。以《庄子·天下篇》这句为例是故内圣外王之道暗而不明郁而不发天下之人各为其所欲焉以自为方。工具分词结果节选Jiayan是 / 故 / 内圣外王 / 之 / 道…天下 / 之 / 人 / 各 / 为 / 其 / 所 / 欲 / 焉 / 以 / 自 / 为 / 方LTP现代模型是 / 故内 / 圣外王 / 之 / 道…各 / 为 / 其 / 所 / 欲 / 焉以自为方HanLP现代模型是故 / 内 / 圣 / 外 / 王之道…各为其所欲焉 / 以 / 自为 / 方可以看到现代工具会把故内、圣外王、焉以自为方这类古文中根本不存在的词切出来。这正是 Jiayan 要解决的问题。二、Jiayan 的两条分词技术路线Jiayan 内置两种分词器对应两种思路分词器原理是否需要词典适用场景CharHMMTokenizer推荐字符级 HMM kenlm 语言模型❌ 无词典古文长文、无词库语料WordNgramTokenizer词典 有向无环词图DAG最大概率路径✅ 需要词库有自建词库时的精细切分核心源码位置字符级 HMM 分词器jiayan/tokenizer/hmm_tokenizer.py词级最大概率路径分词器jiayan/tokenizer/ngram_tokenizer.py文言词库供第二种方式使用jiayan/data/dict.txt配套词库自动构建PMI邻接熵jiayan/lexicon/pmi_entropy_constructor.py本文重点讲第一种——它是最硬核的部分也是无词典文言文分词的关键。三、字符级 HMM把分词变成给每个字打标签1. 问题转化字级标注代替词级切分传统分词需要知道哪些字组成一个词而这正依赖词典。Jiayan 换了个角度不直接找词而是判断每个字处于词的哪个位置。假设最长词为 4 个字那么每个字只可能有 4 种角色标签含义概率计算N元语法b词首第1字p(当前字)c词内第2字p(当前字 | 前1字)d词内第3字p(当前字 | 前2字)e词内第4字p(当前字 | 前3字)这样词级切分就被拆解成了字符级序列标注——一个标准的 HMM 解码问题给定一串字观测序列求最可能的一串标签隐藏状态序列再按b的位置断开切词即可。2. 概率从哪来kenlm 语言模型充当发射概率普通 HMM 分词器需要大量标注语料来统计转移概率和发射概率而古汉语没有公开的分词标注数据。Jiayan 的解法是用一个字符级 N 元语言模型kenlm 格式文件为jiayan.klm来估计发射概率。模型里有一个巧妙的差分技巧见seg_prob方法想让字k处于词内第2字位置就查lm.score(前一字当前字)减去lm.score(前一字)的差值位置越靠后参考的前文越长最长回看 3 个字。语言模型本身是从古文语料按字符切分后训练的构建脚本在jiayan/utils.py的make_kenlm中因此它天生懂古文能给出符合文言语感的局部搭配概率。3. 转移概率手动设定鼓励短词优先HMM 三要素中初始概率、发射概率都能算出来唯独状态转移概率没有数据可统计。Jiayan 直接手动调参转移概率设计意图b→b0.85词首之后大概率又是一个新词的开头b→c0.15小概率继续成词c→b / c→d0.9925 / 0.0075双字词远多于三字词d→b / d→e0.999 / 0.001三字词已较少e→b / e→e0.9999 / 0.0001四字词最少但允许存在规律很清晰越往后越倾向跳回b开新词从而让分词结果自然偏向双字词为主——这恰好符合汉语含文言以二字词为主体的规律也是作者反复微调出的语感参数。4. Viterbi 解码 虚字兜底用 Viterbi 算法见viterbi方法找出整句联合概率最大的标签序列按标签切出候选词切出的词还要过一道虚字校验如果词里含之、而、以、于、为、者、所等文言虚字定义在jiayan/globals.py的stopchars中共 50 余个判定不是合法词退回逐字输出避免之于、所以之类被硬拼成词。四、快速上手3 步跑通文言文分词1️⃣ 安装两步确保 kenlm 版本最新pip install jiayan pip install https://github.com/kpu/kenlm/archive/master.zip2️⃣ 下载预训练语言模型jiayan.klm项目资料中提供用于分词及句读、标点特征提取。3️⃣ 调用分词器示例代码完整收录于jiayan/examples.pyfrom jiayan import load_lm from jiayan import CharHMMTokenizer lm load_lm(jiayan.klm) tokenizer CharHMMTokenizer(lm) text 是故内圣外王之道暗而不明郁而不发天下之人各为其所欲焉以自为方。 print(list(tokenizer.tokenize(text)))输出[是, 故, 内圣外王, 之, 道, , 暗, 而, 不, 明, , 郁, 而, 不, 发, , 天下, 之, 人, 各, 为, 其, 所, 欲, 焉, 以, 自, 为, 方, 。]内圣外王、天下这类文言实词被准确切出单字虚词自然独立——效果完全符合阅读古文的语感。 如果后续用PMIEntropyLexiconConstructor词库构建功能从语料中自动产出了文言词库也可以切换到WordNgramTokenizer它参考了业界经典的 DAG 动态规划方案在词图上用最大概率路径切分适合需要固定词表、控制切分颗粒度的场景。五、原理要点小结与常见疑问为什么不用 BMESB/M/E/S标签M词中语义模糊无法精确定位字在词内的位置发射概率难以用 N 元模型计算b/c/d/e四标签一一对应词内位置天然适配语言模型查表。为什么无监督反而是优势这套流程HMM 分词 → 统计词频 → 构建词库本身就是 Jiayan 生成文言词语料的手段先分词建库库再反哺词级分词与词性标注形成闭环。已知局限源码注释中明确列出速度较慢训练/统计阶段需多次遍历语料Viterbi 逐句解码长词四字及以上效果弱于短词需人工调转移概率平衡词长语料为分词产物词频存在假频故词库构建时改用 N 元模型中的真实共现频次过滤。支持范围受训练语料限制当前版本仅支持简体文言文输入。六、写在最后Jiayan 的分词方案本质是用语言模型补数据、手工参数补统计、HMM 补结构三个替换绕开了古汉语没有标注语料和现成词库这一最大障碍。理解了这个思路你也能把它迁移到其他低资源语言的文本处理中。配合同工具包的词性标注、文言句读断句、自动标点功能一套完整的古文处理流水线就此成型。【免费下载链接】Jiayan甲言专注于古代汉语(古汉语/古文/文言文/文言)处理的NLP工具包支持文言词库构建、分词、词性标注、断句和标点。Jiayan, the 1st NLP toolkit designed for Classical Chinese, supports lexicon construction, tokenizing, POS tagging, sentence segmentation and punctuation.项目地址: https://gitcode.com/gh_mirrors/ji/Jiayan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/24 9:10:18

再也不怕改错提交:StGit undo/redo安全回滚机制详解

再也不怕改错提交:StGit undo/redo安全回滚机制详解 【免费下载链接】stgit Stacked Git 项目地址: https://gitcode.com/gh_mirrors/st/stgit StGit undo/redo 安全回滚机制 是 Stacked Git(简称 StGit)中最让人安心的功能&#xff1…

2026/8/24 9:10:18

mxj十大实战食谱:解决Golang-Nuts经典XML处理难题

mxj十大实战食谱:解决Golang-Nuts经典XML处理难题 【免费下载链接】mxj Decode / encode XML to/from map[string]interface{} (or JSON); extract values with dot-notation paths and wildcards. Replaces x2j and j2x packages. 项目地址: https://gitcode.com…

2026/8/24 11:36:05

AirSim 无人机仿真:30分钟跑通仿真环境

AirSim 无人机仿真:30分钟跑通仿真环境 【免费下载链接】AirSim Open source simulator for autonomous vehicles built on Unreal Engine / Unity, from Microsoft AI & Research 项目地址: https://gitcode.com/gh_mirrors/ai/AirSim 终端里滚过一行 u…

2026/8/24 11:36:05

C++对象模型深度解析:从内存布局到性能优化的底层原理

1. 项目概述:从语法到内存的思维跃迁很多C开发者,包括我自己在早期,都经历过一个典型的瓶颈期:语法规则背得滚瓜烂熟,标准库的常用类也都能上手,写出来的代码功能上似乎也没问题,但总觉得心里没…

2026/8/24 11:36:05

Escrcpy:Android设备镜像控制,多设备同屏

Escrcpy:Android设备镜像控制,多设备同屏 【免费下载链接】escrcpy 📱 Display and control your Android device graphically with scrcpy. 项目地址: https://gitcode.com/GitHub_Trending/es/escrcpy 你面前连着三台 Android 测试机…

2026/8/24 11:31:04

3 分钟怎么搭好微信群消息自动转发

3 分钟怎么搭好微信群消息自动转发 【免费下载链接】wechat-forwarding 在微信群之间转发消息 项目地址: https://gitcode.com/gh_mirrors/we/wechat-forwarding 同时管五六个微信群,试试 wechat-forwarding,一个基于 Python 的微信群消息自动转发…

2026/8/24 0:07:22

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 1:12:32

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 8:17:29

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 1:09:25

3条命令跑通LocalAI:无GPU本地AI引擎部署

3条命令跑通LocalAI:无GPU本地AI引擎部署 【免费下载链接】LocalAI LocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required. 项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI…

2026/8/24 1:09:25

AI推理性能测试怎么做:MLPerf Inference完整上手指南

AI推理性能测试怎么做:MLPerf Inference完整上手指南 【免费下载链接】inference Reference implementations of MLPerf inference benchmarks 项目地址: https://gitcode.com/gh_mirrors/inf/inference 同一个模型换一张卡,速度快多少你知道吗&a…

2026/8/23 13:29:45

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…