为什么需要针灸古典OCR
将经穴、配穴、刺法、灸法的历史积累整理为可供研究的资料
针灸是通过选择人体经穴(通常所说的穴位)及运用刺法、灸法来干预身体的医学技术。从古代到现代,针灸临床一直建立在具体的历史积累之上:针对何种病症,以何种组合(配穴)、何种刺法或灸法使用哪些经穴。对于学习和实践针灸的人,能够追溯文献并核对这些长期积累,是继承和理解技术的重要基础。
另一方面,针灸临床并非依据单一的标准化方法开展。经络治疗、中医针灸、现代针灸、传统家传及各流派独有技术等,多种临床流派和治疗方法并存。各流派依据的古典文献未必相同;只有跨文献阅读,才能立体理解自己所用经穴、配穴与刺法的历史背景。
然而,许多针灸古典尚未整理为可检索的现代数字文本。对于仅以图像提供的文献,无法跨全文检索特定经穴或病症名称,制作日语训读文和现代语译文也需要大量工作。本项目旨在将这些古典文献转化为 机器可读文本 ,以建立研究、比较和整理的基础。这项整理并非为了提出临床推荐,而是为了使古典文献成为可供研究参照的资料。
针灸临床的核心在于经穴(通常所说的穴位)的选择。针对一种病症,使用哪些经穴、如何组合(配穴)、采用何种针刺方式(刺法)或灸法——这些选择影响临床效果。古典记载了长期积累的病症与经穴、配穴、刺法、灸法之间的对应关系。例如,可以提出以下问题。
要回答这些问题,仅阅读某一本教科书并不足够,需要尽可能接近原文地参照多种针灸古典,经过日语训读和现代语翻译后,再进行比较整理。这是 对古典资料的研究性参照,而非临床推荐 。临床判断由各针灸师依据自身流派和临床经验作出;本项目承担的是建立参照基础的工作。
OCR(Optical Character Recognition,光学字符识别)将以图像保存的古典文献页面转为可检索、比较和复制的文字数据。古籍OCR存在不同于现代日语OCR的特殊困难。
因此,本项目使用针对古籍开发的OCR引擎。OCR属于机器处理阶段,原本核对及文本校订仍须作为独立工作逐步开展。
本项目将唐代孙思邈的《备急千金要方》(《千金方》)定位为针灸古典OCR整理的 初步基础 ,并作为首个整理对象。《千金方》是东亚医学史上的百科全书式著作,涵盖药物、处方、针灸及病症,是重要文献。以京都大学贵重资料数字档案(富士川文库)所藏《千金方》RB00003825为底本,已完成全部页面的图像获取和OCR处理。
OCR使用了 NDLkotenOCR-Lite 。这是日本国立国会图书馆公开的古籍OCR引擎,能够处理日本刻本和汉籍中的竖排文本,以及包含变体假名、异体字的页面。
《千金方》全页OCR“完成”,仅意味着机器处理流程完成,并不意味着翻译或文本校订完成。本项目将OCR状态划分如下。
| 阶段 | 含义 | 《千金方》现状 |
|---|---|---|
| 未经校对的OCR结果 | 机器识别已完成的文本。尚未校对,可能存在误读、缺字和换行错位。 | 已完成 |
| TEXT_CLEANED | 修正明显OCR误读,并整理段落和章节结构的状态。 | 尚未开始 |
| 文本已核实 | 经过原本图像核对及专家验证,已完成文本校订的状态。 | 尚未开始 |
目前本项目持有的仅是未经校对的OCR结果,尚未达到文本已核实阶段。不宜直接将《千金方》的这些文本作为临床判断或学术引用的依据。
《千金方》是针灸古典OCR整理的初步基础,今后拟以此为起点,逐步加入下列重要文献。各文献的上传与整理,计划在《千金方》OCR质量评估达到一定阶段后陆续开始。
针灸古典电子文本有多种流通来源。本项目明确区分来源,避免混用不同出处的文本。
这些文本的出处及整理流程不同,比较或引用时必须明确区分来源。
各文献的入口已整理在 东亚医学古典文献目录 中。将从《千金方》《外台秘要》《诸病源候论》等免费介绍页逐步扩充。
针灸古典OCR是本项目的重要领域,但仍处于整理过程中。今后希望建立可跨多种针灸古典检索、参照经穴、配穴、病症、刺法、灸法之间关系的资料环境,让针灸临床工作者及研究者能够核对自身技术的古典背景。这始终是研究基础建设,不自动提出治疗建议。作为MLMN理论 L5(经络层)的基础数据,通过比较多种文献来深化理解。