概念 × 部类分布
把 123 部 / 1,511 万字语料的逐块概念标注(extract×core,29 万关联)按大正藏部类聚合,得到每个概念在全藏的定量分布。这是本站第一个「计算佛学」公开成果:不替代判教,而是给传统判教一面来自语料统计的镜子。
发现 · 空宗输出了词汇表,有宗筑起了术语墙
传统判教把般若(空宗)与唯识(有宗)并列为大乘两翼。机器视角下,两翼在语料中的行为完全不对称:
空系概念是全藏的通用底色——「空」出现在 20 个部类(分布熵 0.80)、「般若」全部 21 个部类(0.80)、「因缘」20 个(0.85)、「第一义」17 个(0.82)。十个空系核心概念的平均分布熵 0.68,是矩阵里最接近均匀分布的一族。
唯识系概念却几乎不出家门——「转依」只在 2 个部类出现(熵 0.05)、「遍计所执性」5 个(0.15)、「圆成实性」4 个(0.26)、「藏识」10 个(0.32)。八个唯识核心概念的平均分布熵 0.22,是全矩阵最强的「方言区」。
最锋利的一组数字来自禅宗语录部:空系概念在《古尊宿语录》中有 127 处 core 关联,唯识系只有 11 处——禅门说的是中观的语言,不是唯识的语言,这件事第一次有了逐块统计的分辨率。
这不判定谁高谁下。判教按教理层位分科,语料按语言扩散分层——「空」成为一切部类的公共语言,恰恰符合般若「共法」的传统自我理解;唯识术语的高度自持,也符合其作为精密论学体系的性格。机器视角的价值在于:这两种性格如今可以被测量。
密度矩阵 · 高频 120 概念 × 19 部类
色阶 = 密度倍率(该部类出现率 ÷ 全藏出现率)<0.5 稀薄0.5–1.5 持平1.5–3 偏多3–8 密集≥8 主场
全藏通用榜(分布熵最高)
| 因緣 | H 0.85 | 20 部类 |
| 五陰 | H 0.84 | 20 部类 |
| 方便 | H 0.84 | 18 部类 |
| 三昧 | H 0.84 | 20 部类 |
| 輪迴 | H 0.83 | 18 部类 |
| 無明 | H 0.83 | 19 部类 |
| 大乘 | H 0.83 | 20 部类 |
| 第一義 | H 0.82 | 17 部类 |
| 供養 | H 0.82 | 18 部类 |
| 慈悲 | H 0.81 | 21 部类 |
方法与边界
- 数据:46,545 语料块的逐块概念提取(不采样,覆盖率 96.7%),仅取 extract×core(该块核心论述)档关联,共 291,382 条中属于高频 300 概念的部分。
- lift = 概念在某部类的每块出现率 ÷ 其全藏出现率;分布熵按 21 部类归一(0=只在一处,1=完全均匀)。律部、论集部因块数过小(<60)不入矩阵。
- 部类是大正藏/卍续藏的文献学分科,本站语料为其选辑(123 部),非全藏普查;「空系/唯识系」的概念取样见页内清单,换一组取样结论方向不变但数值会移动。
- 统计说的是「语言在哪里被使用」,不是「义理在哪里被证成」——判教是诠释传统,本页是语料测量,两者互照而非互代。