爲什麼需要鍼灸古典OCR
將經穴、配穴、刺法、灸法的歷史積累整理爲可供研究的資料
鍼灸是通過選擇人體經穴(通常所說的穴位)及運用刺法、灸法來干預身體的醫學技術。從古代到現代,鍼灸臨牀一直建立在具體的歷史積累之上:針對何種病症,以何種組合(配穴)、何種刺法或灸法使用哪些經穴。對於學習和實踐鍼灸的人,能夠追溯文獻並覈對這些長期積累,是繼承和理解技術的重要基礎。
另一方面,鍼灸臨牀並非依據單一的標準化方法開展。經絡治療、中醫鍼灸、現代鍼灸、傳統家傳及各流派獨有技術等,多種臨牀流派和治療方法並存。各流派依據的古典文獻未必相同;只有跨文獻閱讀,才能立體理解自己所用經穴、配穴與刺法的歷史背景。
然而,許多鍼灸古典尚未整理爲可檢索的現代數字文本。對於僅以圖像提供的文獻,無法跨全文檢索特定經穴或病症名稱,製作日語訓讀文和現代語譯文也需要大量工作。本項目旨在將這些古典文獻轉化爲 機器可讀文本 ,以建立研究、比較和整理的基礎。這項整理並非爲了提出臨牀推薦,而是爲了使古典文獻成爲可供研究參照的資料。
鍼灸臨牀的核心在於經穴(通常所說的穴位)的選擇。針對一種病症,使用哪些經穴、如何組合(配穴)、採用何種針刺方式(刺法)或灸法——這些選擇影響臨牀效果。古典記載了長期積累的病症與經穴、配穴、刺法、灸法之間的對應關係。例如,可以提出以下問題。
要回答這些問題,僅閱讀某一本教科書並不足夠,需要儘可能接近原文地參照多種鍼灸古典,經過日語訓讀和現代語翻譯後,再進行比較整理。這是 對古典資料的研究性參照,而非臨牀推薦 。臨牀判斷由各鍼灸師依據自身流派和臨牀經驗作出;本項目承擔的是建立參照基礎的工作。
OCR(Optical Character Recognition,光學字符識別)將以圖像保存的古典文獻頁面轉爲可檢索、比較和複製的文字數據。古籍OCR存在不同於現代日語OCR的特殊困難。
因此,本項目使用針對古籍開發的OCR引擎。OCR屬於機器處理階段,原本覈對及文本校訂仍須作爲獨立工作逐步開展。
本項目將唐代孫思邈的《備急千金要方》(《千金方》)定位爲鍼灸古典OCR整理的 初步基礎 ,並作爲首個整理對象。《千金方》是東亞醫學史上的百科全書式著作,涵蓋藥物、處方、鍼灸及病症,是重要文獻。以京都大學貴重資料數字檔案(富士川文庫)所藏《千金方》RB00003825爲底本,已完成全部頁面的圖像獲取和OCR處理。
OCR使用了 NDLkotenOCR-Lite 。這是日本國立國會圖書館公開的古籍OCR引擎,能夠處理日本刻本和漢籍中的豎排文本,以及包含變體假名、異體字的頁面。
《千金方》全頁OCR“完成”,僅意味着機器處理流程完成,並不意味着翻譯或文本校訂完成。本項目將OCR狀態劃分如下。
| 階段 | 含義 | 《千金方》現狀 |
|---|---|---|
| 未經校對的OCR結果 | 機器識別已完成的文本。尚未校對,可能存在誤讀、缺字和換行錯位。 | 已完成 |
| TEXT_CLEANED | 修正明顯OCR誤讀,並整理段落和章節結構的狀態。 | 尚未開始 |
| 文本已覈實 | 經過原本圖像覈對及專家驗證,已完成文本校訂的狀態。 | 尚未開始 |
目前本項目持有的僅是未經校對的OCR結果,尚未達到文本已覈實階段。不宜直接將《千金方》的這些文本作爲臨牀判斷或學術引用的依據。
《千金方》是鍼灸古典OCR整理的初步基礎,今後擬以此爲起點,逐步加入下列重要文獻。各文獻的上傳與整理,計劃在《千金方》OCR質量評估達到一定階段後陸續開始。
鍼灸古典電子文本有多種流通來源。本項目明確區分來源,避免混用不同出處的文本。
這些文本的出處及整理流程不同,比較或引用時必須明確區分來源。
各文獻的入口已整理在 東亞醫學古典文獻目錄 中。將從《千金方》《外臺祕要》《諸病源候論》等免費介紹頁逐步擴充。
鍼灸古典OCR是本項目的重要領域,但仍處於整理過程中。今後希望建立可跨多種鍼灸古典檢索、參照經穴、配穴、病症、刺法、灸法之間關係的資料環境,讓鍼灸臨牀工作者及研究者能夠覈對自身技術的古典背景。這始終是研究基礎建設,不自動提出治療建議。作爲MLMN理論 L5(經絡層)的基礎數據,通過比較多種文獻來深化理解。