基本信息

阅读时间:约 17 分钟

字数:约 6733 字

摘要:把笔记库当成一张图,孤立笔记率、枢纽节点度中心性、平均路径长度就能算出来。本文给出三个公式、边口径的确定方法、抽样手算步骤与季度体检清单,帮你量化判断笔记库到底能不能用。

全文语音

中文

English

日本語

한국어

1

先把笔记库看成一张图:节点、边与三种邻接

周维在深圳一家工业相机公司做售后技术支持,34 岁。他的笔记库里躺着一千八百多条现场记录,从"相机连不上交换机"到"低温环境曝光异常",每条都是他蹲在客户车间里、蹲在出差酒店的床上敲出来的。去年年底他被问到一个很普通的要求:上次那个东北客户遇到的偶发断连,是哪台设备、怎么解决的。他翻了二十分钟,没翻到。那条记录确实存在,只是没有任何一条别的笔记指向它,也没有任何一条路径能自然走到它。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 思维导图

"我一直以为我缺的是搜索,"周维后来跟同事说,"其实我缺的是路。笔记都在,但从一个问题走到答案之间没有路,每次都得靠我记得那条路大概在哪、大概叫什么。"这句话后来成了他重整整个库的起点,也是本文三个指标的起点。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

把笔记库读成一张图,只需要两个定义:节点是每一条笔记,边是两个节点之间可以导航的关系。这句话听起来抽象,但它有一个很直接的后果——笔记库好不好用,不再是一个只能靠感觉描述的问题,而是一个能在图上算出来的数。你不必再说"我觉得我的笔记挺散的",你可以给出一个百分比、一个度数、一个跳数,并且下一次还能算出变化。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

麻烦在于,边有三种常见口径,口径不同,三个指标能差出一倍以上。第一种是双向链接:A 里写了指向 B 的链接,同时 B 的反向链接列表里出现 A,这是双链笔记工具里最常见的形态。第二种是单向出链:只算 A 到 B 的方向,能走过去但未必能走回来。第三种是标签共现:两条笔记共享一个标签就认为它们相邻,这种边最省心,也最虚。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

本文统一采用"双向链接为主边、标签共现不计入"的口径。理由是:标签共现会把"待整理""灵感"这类万能标签变成超级枢纽,让所有笔记之间的距离瞬间变成 1,三个指标全部失去分辨力。如果你习惯靠标签导航,可以把标签共现单独算一份对照,但不要和链接边混进同一个数里。体检的第一步不是算,是先写死口径。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图
2

指标一,孤立笔记率:分子分母到底各是什么

孤立笔记率的定义只有一行:ISO = I / N × 100%。其中 N 是参与体检的笔记总数,I 是度数为 0 的笔记数,也就是在当前口径下没有任何一条邻边的笔记。这个指标回答的是一句话——你的库里,有多少笔记是"进得去、出不来、也从别处到不了"的。它们不是丢了,是断了。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 框架图

怎么数分子,比公式本身更容易出错。三个高频坑:一是把待整理的收件箱笔记算进分母,二是把模板、导航首页、日记模板这类结构性笔记算进分母,三是把附件和图片占位笔记算进分母。正确做法是先切层:正式笔记层(写过结论、有标题、有上下文)和暂存层(收件箱、日志、剪藏)。孤立率只在正式笔记层上算,暂存层单独统计,否则你会得到一个被收件箱污染的数字,然后对着它做一堆毫无用处的补救。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

周维的第一个数就是这么来的。按分层口径,他的正式笔记一千一百四十条,其中三百八十九条没有任何双向链接,孤立笔记率 34.1%。这个数字让他自己吃了一惊,他原本的估计是"大概百分之十"。差距来自记忆偏差:人对自己库里反复处理过的部分印象很深,对那些写完就再没打开过的部分完全没有印象,而后者的体量往往被低估一倍以上。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

孤立率不是越低越好。有一类笔记天然就应该孤立:术语卡、单次事件记录、法规条文摘录。它们的作用是被精确检索,不是被连接。所以孤立率要分类型看:概念型笔记的孤立率应该很低,事实型与索引型笔记的孤立率高一些完全正常。更实用的做法是给每类笔记各设一个目标区间,而不是全库共用一把尺子,否则你会逼着自己去连一堆本不需要连的卡片。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

真正有信息量的是变化率,而不是绝对值。孤立率从 34% 降到 28% 看起来是进步,但如果同期正式笔记从 1140 条涨到 1500 条,新增的 360 条里有 180 条是孤立的,那么你本季度的"新增接入率"其实只有 50%——老库在变好,新库在变差。建议把孤立率拆成两个数:存量孤立率(老笔记中的孤立比例)和增量接入率(本季度新增笔记中至少有一条链接的比例)。后者比前者早一个季度预警。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图
3

指标二,枢纽节点:度中心性与那几面承重墙

节点 v 的度数 deg(v) 是与它相连的边的条数。为了让不同规模的库可以横向比较,用 Freeman 归一化度中心性:C_D(v) = deg(v) / (N - 1)。这个值落在 0 到 1 之间,含义是"这条笔记连到了库里多大比例的其它笔记"。在一个两千条的库里,度数 60 的笔记度中心性只有 0.03,看起来微不足道,但它可能已经是平均度数的十几倍。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 对比图

枢纽怎么判定,有三种常用门槛,任选一种并固定下来:统计门槛,度大于等于平均度加两倍标准差;分位门槛,度落在全库前 5%;绝对门槛,度大于等于平均度的三倍且不小于 20。统计门槛在度分布很偏的库里会选出过多的枢纽,绝对门槛在小型库里一个都选不出来,分位门槛最稳。对一千条以上的库,推荐分位门槛配合一个下限,比如前 5% 且度大于等于 10。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

用这个门槛,周维的库里冒出来 57 个枢纽,排在最前面的是一条叫"设备不上电排查树"的笔记,双向链接 47 条。这条笔记本身只有三百多字,是一张从电源、保险丝、网线供电、固件四个分支往下走的判断树。它的价值不在于写了多少内容,而在于四十七条现场记录都从它出发,或者最终回到它——它承担了整个"不上电"主题的导航成本。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

枢纽有两种病。第一种是枢纽缺失:本该成为枢纽的主题被拆成了七八条互不相连的笔记,导致每次查找都要重新走一遍判断树,同样的推理一年重复十几次。第二种是枢纽过载:一条笔记下面挂了上百个链接,变成垃圾桶,谁都能进、谁都找不着。判断枢纽是否过载,看出度与入度的比值:健康枢纽的出度应该显著大于 1,最好在 5 以上;如果一条笔记入度 120、出度 2,那它不是一个枢纽,它是一个堆。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

度分布比平均度数更有信息量。如果你的库是无标度的——极少数节点度数极高、绝大多数节点度数很低——那么度分布近似幂律,平均度数会被那几个超级枢纽拉高到几乎没有参考价值。Barabási 与 Albert 在 1999 年发表于《Science》的论文给出了这类网络的生成机制,即增长加优先连接,来源类型是公开学术文献。对个人知识库的意义很直接:不要看平均度数,看中位数度数和前 5% 的度数,两个数一起看才不会误判。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图
4

指标三,平均路径长度:从一条笔记跳到另一条要几步

两点之间的最短距离 d(i, j),是从 i 走到 j 最少要经过几条边。平均路径长度 L 是所有可达节点对最短距离的平均值:L = 2 / (N × (N - 1)) × Σ_{i小于j} d(i, j)。这个公式隐含的前提是任意两点都可达,也就是图是连通的。真实的知识库几乎从不连通,所以在套公式之前,必须先处理不可达的节点对。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

不可达对有三条口径。口径 A 是推荐做法:只在最大连通分量内计算 L,同时单独报告"最大连通分量占全库节点的比例"。口径 B:把所有不可达对的距离记为一个惩罚值,通常取 N 或 10,好处是能拉开不同库的差距,坏处是这个数没有直观含义。口径 C:按连通分量分别算 L,再用分量大小加权平均。体检报告里建议同时给出 A 口径的 L 和分量覆盖率,两个数缺一个都会误导判断。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

周维的三个数。他的正式笔记层里,最大连通分量覆盖 61% 的节点,在这个分量内 L = 4.7,图直径 11。翻译成人话:从一条随机笔记出发,平均要点五次链接才能走到另一条随机笔记,运气最差的一对要跳十一次。这个 4.7 就是他"翻二十分钟找不到那条记录"的量化版本——不是记忆力问题,是路径问题,而路径是可以改的。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

参考量级。作为对照的几个公开数字:Milgram 在 1967 年的小世界实验里,信件在陌生人间传递的平均链长落在 5 到 6 跳之间;Facebook 研究团队在 2016 年基于当时约十五点九亿活跃用户的关系图测算,任意两人之间的平均距离约 3.57 跳;维基百科条目之间的超链接网络,公开研究的量级估计是 3 到 5 跳。来源类型分别是经典社会学实验、平台研究团队公开报告、公开网络科学文献的量级结论。这些只是量级参照,不是你的目标值——你的库比它们小得多,没有理由比它们更难走。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

为什么要压到三跳以内。每多一跳,你就多做一次"这个链接是不是我要找的"的判断,而每次判断都有放弃的概率。假设每一跳的放弃率是 15%,三跳的累计到达率约 61%,五跳掉到 44%,七跳掉到 32%。这组数字是示意图,仅用于说明衰减的量级,不是实测。三不是一个有理论依据的常数,它是一个实用折中:再往下压,边际收益很小,维护成本却上升得很快。

5

专业分析:图体检三角框架与三份阈值对照

数据基础。三类公开来源可以给个人库定标。其一,结构层面:Watts 与 Strogatz 在 1998 年《Nature》上指出,小世界网络同时具备高聚类系数与短平均路径两个特征——这正是健康知识库应有的形态,主题内聚成簇,簇与簇之间靠少数桥接边连通。其二,规模层面:上文提到的 Facebook 3.57 跳与维基百科 3 到 5 跳,提供了"大图尚且如此"的参照。其三,个人库层面:社区里公开分享的自建库体检结果,来源类型是个人公开分享,样本小且口径不一,大多落在孤立率 20% 到 50%、平均路径 3 到 6 跳的区间内。本文给出的 34.1% 与 4.7 属于示意用示例数据,用于演示算法,不代表普遍水平。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

命名框架:图体检三角(Graph Checkup Triangle,简称 GCT)。三个顶点分别是孤立率 ISO(覆盖率维度)、枢纽度中心性 H(组织度维度)、平均路径长度 L(可达性维度)。判读规则按象限走:ISO 高且 L 高,库是散的,优先补边;ISO 低且 L 高,库是长的,优先做桥接与入口页;ISO 高且 L 低,库是碎的簇,簇内很紧、簇间无路,优先做跨簇桥;ISO 低且 L 低,结构已经健康,此时应该把时间转向内容质量,而不是继续补边。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

框架对比。与 GCT 相对的第一种做法是数量型体检:只统计笔记总数、本月新增数、标签数。它回答"我写了多少",不回答"我能不能用上",因此在笔记越多越焦虑的场景里完全失效。第二种是归档型体检,以 PARA(Projects、Areas、Resources、Archives 四分类)为代表:它检查每条笔记是否落在正确的文件夹里,假设检索主要靠目录树。在链接密集的库里,目录树只是第二导航面,归档正确但没有链接的笔记依然取不出来。第三种就是 GCT 本身:不看存放位置,只看可达性。三者不是替代关系——数量型看产能、归档型看秩序、GCT 看可用性,建议按季度轮换关注点。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

案例的量化结果。周维在两个月的整改里只做了三件事:给 57 个枢纽各补一份入口说明;为三百八十九条孤立笔记中真正有价值的 214 条各补两条链接,一条指向上游概念、一条指向同类现场记录;把 11 条过载枢纽拆成索引页加子页。整改后的三个数:孤立率 34.1% 降到 19.6%,最大连通分量覆盖率 61% 升到 78%,L 从 4.7 降到 3.2。他自己的主观变化是:找一个案例,八成情况下三次点击内就能到。以上数字为按其记录整理的示例数据。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

四个派生指标。三角之外还有四个值得进报告的派生量:连通分量覆盖率 MCC,等于最大连通分量节点数除以全库节点数,建议目标不低于 75%;度分布基尼系数,衡量链接分布的不平等程度,0.6 以上说明过度集中在少数枢纽;图直径,即最长的最短路径,比 L 更敏感地暴露被遗忘的角落;介数中心性,用来找出那些度数不高、却处在两簇之间唯一通道上的桥节点。桥节点比枢纽更值得保护,因为删掉一条桥,两个簇就彻底断开,而一个枢纽塌了通常还有替代路径。

执行清单。第一步,固定口径:双向链接为主边,排除模板、收件箱与附件,写进季度记录后不再变。第二步,全量跑脚本或按后面一章做抽样,产出 ISO、H、L、MCC 四个数。第三步,按 GCT 四象限判读,只做一个动作——补边、架桥、拆分,或者暂停。第四步,给本季度新增笔记单独算接入率。第五步,把数字与上一季并列,看变化而不是看绝对值,趋势比单次快照有用得多。

6

抽样手算:不写脚本也能算出这三个数

为什么可以手算。三个指标里,孤立率和度中心性只需要数数,平均路径长度需要一次广度优先遍历。全量算一千条笔记的 L 要做一千次遍历,写脚本只要几秒,手算不现实。但抽样手算足以支撑量级判断:随机抽 100 条,误差通常在几个百分点(示意量级),用来判断"我的库是 20% 还是 50%"完全够用,也足以决定本季度该做哪一个动作。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

第一步,抽样本。把全库笔记按创建时间排序编号,用随机数表或电子表格的随机函数抽 100 个编号,抽到收件箱、模板、附件就跳过重抽。把抽到的 100 条标题抄在一张纸上——这一步不能省,后面所有的计数都在这张纸上完成,靠工具界面来回切换会数错,而且错得毫无察觉。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

第二步,算孤立率。逐条打开这 100 条,看反向链接面板。零反向链接、自己也没往外连任何一条的,记一个正字。100 条里如果有 31 条是这样,你的孤立率估计就是 31%。同时把每条的反向链接条数记在标题旁边,得到一列度数,这一列在第三步和第四步里还要用到。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

第三步,算枢纽门槛。把这一列度数从小到大排,取第 95 百分位,100 条里就是第 95 个数,这就是本次抽样的枢纽门槛。再数一数有多少条的度数达到或超过它,这些就是候选枢纽。把它们抄下来单独看一眼:如果大多是你意料之中的主题页,说明库的骨架是清楚的;如果里面混着几条你完全想不起来的笔记,通常意味着某次批量操作留下了意外的链接,需要清理。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

第四步,估平均路径。从样本里随机选 3 条作为起点,对每条做三层广度优先:第 0 层是它自己,第 1 层是它直接连到的笔记,第 2 层是第 1 层连到且未出现过的笔记,第 3 层同理。记下每层数量,得到一个漏斗,比如 1 到 6 到 23 到 58。漏斗张开得快,说明局部密集、整体可达性不错;如果第 2 层只有 8 条、第 3 层只有 9 条,说明走两步就撞墙,L 大概率在 5 以上。三层漏斗覆盖的节点越多,全库的 L 越低。

7

降距工程:把平均路径压下来的四种改动

四种改动按性价比排序:桥接孤立簇最便宜,建入口页次之,拆过载枢纽再次,合并同义标签最贵。每单位投入能压低的 L 依次递减,所以不要一上来就整理标签——那是成本最高、见效最慢的一种,很容易在见到任何数字改善之前就把热情耗光。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

改动一,桥接孤立簇。用工具把库按连通分量着色,你会看到几个小簇漂在主岛外面。每个小簇只要补一到两条指向主岛的链接就能并进来,MCC 提升明显,L 也会小幅下降。周维的库里有 23 个三到八条的小簇,补了 31 条边就全部接上主岛,这是他两个月里投入产出比最高的一项,也是唯一一项当天就能看到数字变化的。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

改动二,建入口页。入口页也叫 MOC,即内容地图,它不是新的知识,只是一张指向其它笔记的目录。它的作用是给每个主题造一个第 0 层,让从该主题任意一条笔记出发的路径都缩短一跳。经验做法是每 30 到 50 条同主题笔记配一个入口页,入口页自身的出度控制在 15 到 40 之间,超过 40 就该拆成两级。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

改动三,拆过载枢纽。判断标准是入度与出度的比值:比值超过 20 且入度超过 80,就该拆。拆法不是把笔记删短,而是把它的出链按分支分给若干子页,原来的枢纽页只保留指向子页的链接。这样它从一个堆变成了一个真正的索引,路径长度基本不变,但每一跳的判断成本大幅下降,查找时的放弃次数会明显减少。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

收益递减的拐点。L 从 5 降到 3.5 相对容易,靠桥接和入口页就能做到;从 3.5 降到 2.5 要动到标签体系和笔记拆分;再往下压到 2 以下,通常意味着库已经小到不值得用图来衡量,或者你已经把大量笔记合并成了少数几个巨型页——后者是另一种退化。建议把 2.8 到 3.5 作为稳态区间,到达后停止补边,把时间还给写作本身。

8

三个指标的误读边界

孤立不等于无用。术语卡、人名卡、标准条款摘录这类笔记的价值在于被精确检索,把它们全部连出去反而会稀释主题簇的密度,让 L 好看、让查找变难。判断一条孤立笔记该不该补边,看它在过去半年里被打开过几次:一次都没打开过的,大概率是沉没资产,补边不如归并或归档。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

高平均路径不一定坏。以分层目录为主要导航的库,比如按项目逐年归档的交付记录,L 天然偏高,但使用者的查找路径是先定位目录再进入,并不依赖链接跳跃。这类库的体检重点应该换成目录树的一致性与命名规范,L 只作参考。用一个不匹配自己导航方式的指标来要求自己,是最常见的一种误伤。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

枢纽多不等于好。如果前 5% 的枢纽里有大量互相链接的笔记,它们会形成一个枢纽团,从外面看链接很多,实际上是在小圈子里绕圈。检查方法是看枢纽之间的平均距离:如果它们两两之间的距离大多是 1,说明枢纽重叠严重,需要合并而不是增加。合并之后度数会下降,但可达性反而改善。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

单次快照不可比。三个指标都对口径极度敏感,换了边的定义、换了分层方式、经历一次批量导入,数字就会跳。可比的前提是口径不变。建议在记录里固定写一行"本次口径:双向链接、排除收件箱与模板、仅正式笔记层",下次照抄,任何一次口径变更都要在旁边标注,那一期的数据才算作废得明明白白。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

别被可视化骗了。绝大多数笔记工具的图谱视图用的是力导向布局,簇是被画出来的,不是算出来的。两个在屏幕上离得很远的簇,可能只差一条边;一个看起来密不透风的区域,可能全是标签共现造成的假密度。视觉能给你假设,数字才能给你结论,而假设必须被数字验证之后才值得动手。

9

季度体检执行清单

先定周期。建议季度一次,每次不超过一个晚上。频率太高会变成整理癖——补边本身会产出新的笔记,而新笔记又会拉高孤立率,你会陷入一个自己制造的循环。频率太低则看不出趋势。新增笔记量很大(每周三十条以上)的可以改成月度,但月度只算增量接入率,三个主指标仍按季度出。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

清单第一项,口径复核。打开上一次的记录,确认这次的分层方式、边的定义、参与统计的笔记类型完全一致。不一致就先补算一份可比的旧值,否则这一期的报告作废,而且你会把它当成真实的改善或退步,做出错误动作。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

清单第二项,跑数与记录。产出 ISO、枢纽门槛度数、L、MCC 四个数,与上一季并列写进一张表。表里再加两列:本季度新增笔记数、新增笔记接入率。六个数字一行,一年四行,趋势就出来了,而趋势比任何一次快照都更能说明你的习惯是否真的改变了。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

清单第三项,只做一个动作。按 GCT 四象限确定本季度的唯一动作:补边、架桥、拆分,或者暂停结构改动转向内容。同时做三件事的结果是三件都做一半,下一季度的数字不会有任何一项达标。

给知识库做体检:孤立笔记率、枢纽节点与平均路径长度,这三个指标怎么算 配图

清单第四项,抽样复核。从本季度新增笔记里随机抽 20 条,人工走一遍从入口页到该笔记的路径,记录实际跳数与放弃次数。这是唯一能校验 L 是否真的反映使用体验的办法——数字说三跳,但你两次就想放弃,那说明问题不在路径长度,在链接的命名质量。数字与体感不一致时,永远以体感为准去复查口径。

FAQ

常见问题

1.问:我的笔记库只有两百条,这三个指标还有意义吗?

答:有意义,但要换判读方式。两百条以内时孤立率的波动会很剧烈,新增十条未连接的笔记就能把 ISO 从 20% 推到 25%,这个幅度没有信息量。小库建议只盯两个量:孤立笔记的绝对条数,保持在新笔记总数的三分之一以内;以及是否存在至少一个覆盖全库六成以上笔记的连通分量。平均路径长度在小库里通常只有两到三跳,区分度很低,可以不算,等笔记超过五百条再启用完整的三个指标。

2.问:用双链笔记工具和用文件夹工具,算出来的数可以直接比较吗?

答:不能直接比较,除非边口径一致。文件夹工具里天然的边是"同目录"关系,双链工具里天然的边是"互相链接"关系,前者是隐式边、后者是显式边。要在两者之间比较,先把文件夹工具的边定义成"同一末级目录下的笔记两两相邻",再套同一个公式,得出的 ISO 和 L 才有可比性。混用口径得出的结论,往往是"用双链工具的人库更散",而实际上只是他们的边更少、更挑剔,每条链接都是人工确认过的。

3.问:我把孤立率压到 10% 了,为什么查找还是慢?

答:因为查找速度不只取决于结构,还取决于链接的命名质量。平均路径长度假设每一次跳跃都是零成本判断,但现实中每一跳都要读链接文字并决定点不点。如果你的链接文字全是"见上""相关""参考",三步跳跃的实际代价可能高于命名清楚的五步。下一步可以立刻执行:抽查二十条枢纽笔记,把泛指的链接文字改成"结论句加指向对象"的形式,比如把"详见"改成"低温下曝光异常的三个成因",改完再走一遍抽样路径,对比放弃次数是否下降。


图片来源:图1 soap0119 / Pixabay (CC0) · 图2 Guddanti / Pixabay (CC0) · 图3 ArWeltAtty / Pixabay (CC0) · 图4 ewa69 / Pixabay (CC0) · 图5 PublicDomainPictures / Pixabay (CC0) · 图6 rainerh11 / Pixabay (CC0) · 图7 analogicus / Pixabay (CC0) · 图8 wal_172619 / Pixabay (CC0) · 图9 hbieser / Pixabay (CC0) · 图10 fatherfab / Pixabay (CC0) · 图11 TonW / Pixabay (CC0) · 图12 MasterTux / Pixabay (CC0) · 图13 zoosnow / Pixabay (CC0) · 图14 Guddanti / Pixabay (CC0) · 图15 jonleong64 / Pixabay (CC0) · 图16 schuetz-mediendesign / Pixabay (CC0) · 图17 jarmoluk / Pixabay (CC0) · 图18 PublicDomainPictures / Pixabay (CC0) · 图19 Firmbee / Pixabay (CC0) · 图20 Kost9n4 / Pixabay (CC0) · 图21 Pexels / Pixabay (CC0) · 图22 KingsInnPhotography / Pixabay (CC0) · 图23 stevepb / Pixabay (CC0) · 图24 Moon_station / Pixabay (CC0) · 图25 ZADEWEN1024 / Pixabay (CC0) · 图26 ZADEWEN1024 / Pixabay (CC0) · 图27 ZADEWEN1024 / Pixabay (CC0) · 图28 ZADEWEN1024 / Pixabay (CC0) · 图29 12019 / Pixabay (CC0) · 图30 marmax / Pixabay (CC0) · 图31 KingsInnPhotography / Pixabay (CC0) · 图32 chulhwan / Pixabay (CC0) · 图33 WikiImages / Pixabay (CC0) · 图34 ELG21 / Pixabay (CC0) · 图35 Tama66 / Pixabay (CC0) · 图36 henryleester / Pixabay (CC0) · 图37 MiraCosic / Pixabay (CC0) · 图38 Dimhou / Pixabay (CC0) · 图39 MiraCosic / Pixabay (CC0) · 图40 focusonpc / Pixabay (CC0)


本文为认知与方法论科普,不构成任何投资建议。