中医古籍集:12 本医书的繁简对照与双源校验
整理了 12 本中医经典与扩展医籍,统一存成一个文件夹,每篇以繁體原文与简体对照并列。
但这次的重点不是”收进来”,而是怎么保证它是对的。
为什么必须双源校验
单一来源的”正确”是不可验证的。所以每一本都用了两个互相独立的底本:
| 底本 | 说明 | |
|---|---|---|
| A | Kanseki Repository(kanripo) |
四库系校勘本,逐卷整理,并保存历代注家的注解文字 |
| B | TCM-Ancient-Books | 现代整理标点本,篇目结构完整,带现代标点 |
正文取自底本 B(可读性好、带现代标点),再用底本 A 逐篇比对确认无缺漏臆改。
比对方法:两源统一为简体汉字、去标点后,用多重锚点定位 + 局部序列比对,逐篇计算一致度。
采集中排掉的一个坑
最初用的是 Chinese Text Project(ctext.org)。它的首页明确写着:会对爬虫故意返回损坏数据, 而且抓取其内容违反其服务条款。中文古籍一旦被静默改动很难发现,所以这个来源直接弃用了。
过程中还踩到一个更隐蔽的坑:底本 B 的 .txt 实际是 GB18030 编码,
最初按 UTF-8 容错解码,每本书从十万字悄悄变成了一千字——而且不报错。
改成严格解码(不匹配即报错)之后才拿到真文本。
书目与校验结果
| 序号 | 书名 | 分类 | 一致度 | 全文 |
|---|---|---|---|---|
| 01 | 黄帝内经·素问 | 核心经典 | ⚠️ 69.5% | 《黄帝内经·素问》 |
| 02 | 黄帝内经·灵枢 | 核心经典 | ⚠️ 17.8% | 《黄帝内经·灵枢》 |
| 03 | 伤寒论 | 核心经典 | ⚠️ 42.1% | 《伤寒论》 |
| 04 | 金匮要略 | 核心经典 | ✅ 81.6% | 《金匮要略》 |
| 05 | 难经 | 核心经典 | ✅ 87.6% | 《难经》 |
| 06 | 神农本草经 | 核心经典 | 单一来源 | 《神农本草经》 |
| 07 | 针灸甲乙经 | 扩展经典 | ✅ 90.2% | 《针灸甲乙经》 |
| 08 | 脉经 | 扩展经典 | ✅ 88.5% | 《脉经》 |
| 09 | 温病条辨 | 扩展经典 | 单一来源 | 《温病条辨》 |
| 10 | 脾胃论 | 扩展经典 | ✅ 88.8% | 《脾胃论》 |
| 11 | 本草纲目 | 扩展经典 | ✅ 89.7% | 《本草纲目》 |
| 12 | 本草纲目拾遗 | 扩展经典 | 单一来源 | 《本草纲目拾遗》 |
共 2112 篇,端到端完整性检查通过:每篇简体与来源逐字一致,每篇繁体恰为对应简体的 s2t 结果。
怎么读这些数字
- ≥0.85:该篇与四库底本高度一致,可直接采用。
- ≥0.70:基本一致,差异多来自标点断句与繁简字形。
- ⚠️ 偏低:《灵枢》《伤寒论》《素问》一致度偏低,不是底本有错, 而是这些版本把注家注解逐句嵌在正文中间(如成无己《注解伤寒论》), 与现代整理本的断句编排差异极大,连续匹配被打断。 这三本我给不出同等强度的保证,关键条文请核对纸本。
未做交叉校验的三本:《神农本草经》《温病条辨》《本草纲目拾遗》—— 本次未能找到第二个独立权威底本(Wikimedia 系站点在本机网络被整体拦截),已在各篇开头标明。
《本草纲目》为节选交付(卷一序例本例凡例 32 篇 + 常用药 75 条), 但校验是针对全书 1816 篇做的。
文件在哪
中医古籍/
├── README.md 书目索引
├── 校验报告.md 逐篇校验结果 + 人工复核清单
├── books/ 12 个 .md 正文(繁體原文 + 简体对照)
├── _sources/ 两个来源的原始下载文本(未修改,可逐字比对)
└── _tools/ 下载、校验、生成脚本
原始下载文本完整保留在 _sources/raw/,
任何一处存疑都可以直接与成品逐字对照——这是”确保正确”唯一可靠的做法。
⚠️ 中医古籍仅供学习研究参考,不作为诊疗依据;临床用药请遵医嘱。