文章目录

中医古籍集:12 本医书的繁简对照与双源校验

中医古籍集:12 本医书的繁简对照与双源校验

整理了 12 本中医经典与扩展医籍,统一存成一个文件夹,每篇以繁體原文与简体对照并列。

但这次的重点不是”收进来”,而是怎么保证它是对的。


为什么必须双源校验

单一来源的”正确”是不可验证的。所以每一本都用了两个互相独立的底本:

底本 说明
A Kanseki Repository(kanripo) 四库系校勘本,逐卷整理,并保存历代注家的注解文字
B TCM-Ancient-Books 现代整理标点本,篇目结构完整,带现代标点

正文取自底本 B(可读性好、带现代标点),再用底本 A 逐篇比对确认无缺漏臆改。

比对方法:两源统一为简体汉字、去标点后,用多重锚点定位 + 局部序列比对,逐篇计算一致度。

采集中排掉的一个坑

最初用的是 Chinese Text Project(ctext.org)。它的首页明确写着:会对爬虫故意返回损坏数据, 而且抓取其内容违反其服务条款。中文古籍一旦被静默改动很难发现,所以这个来源直接弃用了。

过程中还踩到一个更隐蔽的坑:底本 B 的 .txt 实际是 GB18030 编码, 最初按 UTF-8 容错解码,每本书从十万字悄悄变成了一千字——而且不报错。 改成严格解码(不匹配即报错)之后才拿到真文本。


书目与校验结果

序号 书名 分类 一致度 全文
01 黄帝内经·素问 核心经典 ⚠️ 69.5% 《黄帝内经·素问》
02 黄帝内经·灵枢 核心经典 ⚠️ 17.8% 《黄帝内经·灵枢》
03 伤寒论 核心经典 ⚠️ 42.1% 《伤寒论》
04 金匮要略 核心经典 ✅ 81.6% 《金匮要略》
05 难经 核心经典 ✅ 87.6% 《难经》
06 神农本草经 核心经典 单一来源 《神农本草经》
07 针灸甲乙经 扩展经典 ✅ 90.2% 《针灸甲乙经》
08 脉经 扩展经典 ✅ 88.5% 《脉经》
09 温病条辨 扩展经典 单一来源 《温病条辨》
10 脾胃论 扩展经典 ✅ 88.8% 《脾胃论》
11 本草纲目 扩展经典 ✅ 89.7% 《本草纲目》
12 本草纲目拾遗 扩展经典 单一来源 《本草纲目拾遗》

共 2112 篇,端到端完整性检查通过:每篇简体与来源逐字一致,每篇繁体恰为对应简体的 s2t 结果。


怎么读这些数字

  • ≥0.85:该篇与四库底本高度一致,可直接采用。
  • ≥0.70:基本一致,差异多来自标点断句与繁简字形。
  • ⚠️ 偏低:《灵枢》《伤寒论》《素问》一致度偏低,不是底本有错, 而是这些版本把注家注解逐句嵌在正文中间(如成无己《注解伤寒论》), 与现代整理本的断句编排差异极大,连续匹配被打断。 这三本我给不出同等强度的保证,关键条文请核对纸本。

未做交叉校验的三本:《神农本草经》《温病条辨》《本草纲目拾遗》—— 本次未能找到第二个独立权威底本(Wikimedia 系站点在本机网络被整体拦截),已在各篇开头标明。

《本草纲目》为节选交付(卷一序例本例凡例 32 篇 + 常用药 75 条), 但校验是针对全书 1816 篇做的。


文件在哪

中医古籍/
├── README.md        书目索引
├── 校验报告.md      逐篇校验结果 + 人工复核清单
├── books/           12 个 .md 正文(繁體原文 + 简体对照)
├── _sources/        两个来源的原始下载文本(未修改,可逐字比对)
└── _tools/          下载、校验、生成脚本

原始下载文本完整保留在 _sources/raw/, 任何一处存疑都可以直接与成品逐字对照——这是”确保正确”唯一可靠的做法。


⚠️ 中医古籍仅供学习研究参考,不作为诊疗依据;临床用药请遵医嘱。

See Also