SegmentIt 快速上手:任何 JS 环境跑通中文分词的新手教程

📅 发布时间:2026/8/21 19:15:50
SegmentIt 快速上手:任何 JS 环境跑通中文分词的新手教程
SegmentIt 快速上手任何 JS 环境跑通中文分词的新手教程【免费下载链接】segmentit任何 JS 环境可用的中文分词包fork from leizongmin/node-segment项目地址: https://gitcode.com/gh_mirrors/se/segmentitSegmentIt 是一个在任何 JS 环境都能用的中文分词包Node、浏览器、Electron 直接运行无需编译原生的 nodejieba。它把中文句子切分成带词性的单词数组一行doSegment出结果适合做搜索、NLP 预处理的前端和 Node 开发者。3 分钟跑通第一个分词示例安装只需一条命令npm i segmentit然后两行代码初始化、一次调用出结果import { Segment, useDefault } from segmentit; const segmentit useDefault(new Segment()); const result segmentit.doSegment(工信处女干事每月经过下属科室都要亲口交代24口交换机); console.log(result);useDefault(new Segment())会一次性载入全部内置模块和字典盘古词库、人名、同义词、停用词返回的每个词是{ w: 单词, p: 词性编码 }结构。注意p是十六进制位掩码编码不是直观标签想看懂它请往下看场景二。浏览器里不用构建工具也能跑引用dist/umd/segmentit.js后所有调用前加Segmentit.前缀即可例如Segmentit.useDefault(new Segmentit.Segment())。按场景用三个最常用的姿势批量处理语料只要纯词不要杂音做词频统计或搜索索引时标点和停用词都是噪音。手动过滤太麻烦把选项传给doSegment就能一次完成segmentit.doSegment(因为李三买了一张三角桌子, { simple: true, stripPunctuation: true, stripStopword: true, }); // → [李三, 买, 一张, 三角, 桌子]输出结巴风格的词性标注做实体抽取、语法分析时你需要知道哪个是人名、哪个是动词。cnPOSTag/enPOSTag能把编码翻译成中文或结巴风格标签import { cnPOSTag, enPOSTag } from segmentit; segmentit.doSegment(一人得道鸡犬升天) .map(i ${i.w} ${cnPOSTag(i.p)} ${enPOSTag(i.p)}); // → [一人得道 习语,数词 数语素 l,m, 标点符号 w, ...]领域词识别不到挂上自己的词表盘古词库偏复古软萌萝莉这类新词根本不在里面行业术语同理。你不需要改源码loadDict加载自定义词表即可格式一行一个词|词性|词频segmentit.loadDict(元宇宙|0x100000|100\n大模型|0x100000|200); 注意如果项目用 ESM 打包只 import 你需要的模块和字典如ChsNameTokenizer、names没用的字典会被 tree shaking 摇掉打包体积从全量 3.8M 大幅下降。doSegment 参数对照表真正影响输出结果的只有这 4 个选项全部是布尔值参数作用默认值simple只返回单词字符串数组丢掉词性falsestripPunctuation过滤标点符号 tokenfalseconvertSynonym按同义词表把词统一成标准词会反复转换直到稳定falsestripStopword过滤停用词表里的词false新手最容易踩的 3 个坑长文本分词卡死、内存暴涨原因Tokenizer 是中间件式逐词传递文本越长 token 数组越大。解决doSegment内部会按换行符切段所以先把长文按行拆开、逐段分词再拼接不要整篇硬塞。浏览器里Segment报 undefined原因UMD 版挂在全局对象Segmentit下而不是直接暴露。解决初始化写成Segmentit.useDefault(new Segmentit.Segment())所有 API 都加前缀。新词被切碎词频/词性也不对原因内置盘古词库较旧且词表里只有词|词性|词频三列信息缺了词性就只影响识别。解决用loadDict追加自定义词表词性列对照 src/POSTAG.js 里的编码表填写。SegmentIt 的核心就是装包 → useDefault → doSegment三步剩下都是按需裁剪。想深入自定义 Tokenizer / Optimizer 机制可阅读 README.md 与源码目录 src/module/。【免费下载链接】segmentit任何 JS 环境可用的中文分词包fork from leizongmin/node-segment项目地址: https://gitcode.com/gh_mirrors/se/segmentit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考