概念 × 部類分佈
把 123 部 / 1,511 萬字語料的逐塊概念標註(extract×core,29 萬關聯)按大正藏部類聚合,得到每個概念在全藏的定量分佈。這是本站第一個「計算佛學」公開成果:不替代判教,而是給傳統判教一面來自語料統計的鏡子。
發現 · 空宗輸出了詞彙表,有宗築起了術語牆
傳統判教把般若(空宗)與唯識(有宗)並列為大乘兩翼。機器視角下,兩翼在語料中的行為完全不對稱:
空系概念是全藏的通用底色——「空」出現在 20 個部類(分佈熵 0.80)、「般若」全部 21 個部類(0.80)、「因緣」20 個(0.85)、「第一義」17 個(0.82)。十個空系核心概念的平均分佈熵 0.68,是矩陣裡最接近均勻分佈的一族。
唯識系概念卻幾乎不出家門——「轉依」只在 2 個部類出現(熵 0.05)、「遍計所執性」5 個(0.15)、「圓成實性」4 個(0.26)、「藏識」10 個(0.32)。八個唯識核心概念的平均分佈熵 0.22,是全矩陣最強的「方言區」。
最鋒利的一組數字來自禪宗語錄部:空系概念在《古尊宿語錄》中有 127 處 core 關聯,唯識系只有 11 處——禪門說的是中觀的語言,不是唯識的語言,這件事第一次有了逐塊統計的分辨率。
這不判定誰高誰下。判教按教理層位分科,語料按語言擴散分層——「空」成為一切部類的公共語言,恰恰符合般若「共法」的傳統自我理解;唯識術語的高度自持,也符合其作為精密論學體系的性格。機器視角的價值在於:這兩種性格如今可以被測量。
密度矩陣 · 高頻 120 概念 × 19 部類
色階 = 密度倍率(該部類出現率 ÷ 全藏出現率)<0.5 稀薄0.5–1.5 持平1.5–3 偏多3–8 密集≥8 主場
全藏通用榜(分佈熵最高)
| 因緣 | H 0.85 | 20 部類 |
| 五陰 | H 0.84 | 20 部類 |
| 方便 | H 0.84 | 18 部類 |
| 三昧 | H 0.84 | 20 部類 |
| 輪迴 | H 0.83 | 18 部類 |
| 無明 | H 0.83 | 19 部類 |
| 大乘 | H 0.83 | 20 部類 |
| 第一義 | H 0.82 | 17 部類 |
| 供養 | H 0.82 | 18 部類 |
| 慈悲 | H 0.81 | 21 部類 |
方法與邊界
- 數據:46,545 語料塊的逐塊概念提取(不採樣,覆蓋率 96.7%),僅取 extract×core(該塊核心論述)檔關聯,共 291,382 條中屬於高頻 300 概念的部分。
- lift = 概念在某部類的每塊出現率 ÷ 其全藏出現率;分佈熵按 21 部類歸一(0=只在一處,1=完全均勻)。律部、論集部因塊數過小(<60)不入矩陣。
- 部類是大正藏/卍續藏的文獻學分科,本站語料為其選輯(123 部),非全藏普查;「空系/唯識系」的概念取樣見頁內清單,換一組取樣結論方向不變但數值會移動。
- 統計說的是「語言在哪裡被使用」,不是「義理在哪裡被證成」——判教是詮釋傳統,本頁是語料測量,兩者互照而非互代。