智能 · 第四位置

量。

《名实》停在一个问题上:三种本体论互不可通约,出路不可能来自其中任何一个内部。这一篇去看那个位置有没有人在施工。答案是有的,图纸还出乎意料。不是第四种世界观,是一套担保协议,其中三张直接画在印度的量论上。

六量:担保的分类 无体:漏掉的那一格 出处:画进注意力 资格:没人被要求

BG1SB  ·   ·  约 30 分钟

《名实》第五节留了一个没答的问题。三种本体论各自把 AI 当成一个东西来治理,彼此翻译不过去。协调失败不是因为价值观有分歧,是因为缺少一个共同的指涉对象。出路在哪?这一篇去现场找,找到的东西比预想的具体。

使同乎若者正之,既与若同矣,恶能正之?使同乎我者正之,既同乎我矣,恶能正之?使异乎我与若者正之,既异于我与若矣,恶能正之?使同乎我与若者正之,既同乎我与若矣,恶能正之?然则我与若与人俱不能相知也,而待彼也邪?

让同意你的人来判定,他既然已经同你了,怎么能判定?让我这边的人来判定,他既然已经同我了,怎么能判定?让与你我都不同的人来判定,他既然与你我都不同,怎么能判定?让与你我都相同的人来判定,他既然与你我都相同了,怎么能判定?那么你我和别人都不能互相知道,还是要等那一个吗?

《庄子·齐物论》

庄子把四种裁判全试了一遍,四种都不成立。他没有给出第五种,只留了一个空位,叫彼。那个位置两千三百年空着,现在开始有人往里施工。施工的东西不是第四种世界观,是一张表。

TL;DR — 第四位置的六条现场记录

  • 事实第四位置已经在施工,图纸直接取自印度量论。NabaOS 按 pramāṇa 给每条主张分类:现量(工具直接输出)、比量(推论)、声量(外部证言)、无体(缺失)、无据意见。运行时签发 HMAC 工具收据,模型伪造不了,再拿主张去对收据。1800 条场景、四种语言、六类注入幻觉,测出伪造工具引用 94.2%、计数错报 87.6%、虚假缺失主张 91.3%,每条回复开销低于 15 毫秒。对照 zkLLM 每次查询 180 秒。
  • 事实出处可以做进注意力机制。标准 transformer 没有来源权威的架构概念,检索文档、用户输入、系统指令走同一条无差别注意力,模型只能靠措辞猜该听谁的。给每个 token 加环 ID、加来源嵌入与来源注意力偏置之后,对间接提示注入的抵抗在分布内外都成立。《名实》里那个 45% 到 88% 的权威翻转率,机制就在这里。
  • 事实治理的名与实,已经量到 135 个国家。负责任 AI 全球指数 2026 收集 68138 个数据点、38 项指标。126/135 国至少有一项政府 AI 政策。但全球南方在 306 件新增框架案例里占 203 件,其中 78% 不具约束力,全球北方是 42%。透明度与可解释性有框架的国家占 58%,要求公开政府算法的只有 18%。35 个国家查到政府部署不可接受风险系统的可信证据。
  • 推断第四位置不能是第四种本体论。中国提议的世界人工智能合作组织,被一项对 15 份国际文书的编码分析读作「第二极」,围绕主权与发展组织,而不是权利与安全。多加一种本体论只会多一个不可通约项。能跨三方的只有担保协议:出处、量、资格。它不问 AI 是什么,只问你凭什么这么说,以及谁有权说你不成立。
  • 论点三件里最缺的是资格。一份十年审计实践的报告写得很直白:拉美、撒哈拉以南非洲、亚太,十年间已发表的第二方与第三方部署系统审计不足二十次,对面是数百个有记录的公共部门算法和数十亿美元的国家 AI 投资。原因不是能力,是资金。目前没有任何一方被要求、或被出钱,去让已部署的系统负责。
  • 已排除本文不主张第四位置属于某个文明。信息自决这个概念源自德国 1983 年人口普查判决,印度最高法院在 Puttaswamy 案里采纳了它。量论的实现者里有印度团队,也有把 Navya-Nyāya 形式化进立方类型论的人。位置不属于文明,属于协议。

3 分钟读完:§03 无体 · §06 极还是层 · §08 本站

四种裁判都不成立

庄子给了形式论证。2026 年的语义网络分析给了同一个论证的政策文本版本。

《名实》引过那项研究:欧盟把 AI 法理化为可认证的产品,美国把它操作化为可优化的系统,中国把它治理为社会技术基础设施。三方用同一套词汇,治理着本体论上不同的对象。作者的结论是,协调失败不是因为价值观有分歧,是因为缺少一个共同的指涉对象。

这个结论留下一个死结。如果分歧在本体论层面,那么任何调停者都必须先选定一种本体论,而一选定,它就成了争议的一方。庄子把这个死结论证得比谁都干净:同于你的不能判,同于我的不能判,异于你我的不能判,同于你我的也不能判。四种裁判穷尽了,全不成立。

他还留了第五种,就是那个「彼」。但他没说彼是什么,只说了一句「而待彼也邪」,还是要等那一个吗。这个空位就是本文要去看的地方。

2026 年有一项研究把第五种裁判也否掉了,而且否得很实。它指出人机交互里存在一种此前没有名字的风险,叫共同建构盲区:每一个使用对话模型的人都在闭环之内,不在闭环之上,而每一份部署免责声明都把他摆在外部审计者的位置上。同一篇还记录了一个次级机制,叫结构性顺从:一个模型承认它对某位公众人物过于温和,因为这个人的著作就在它的训练数据里。

推断 · 用户不能当那个「彼」

把这条接到庄子的论证上,四种裁判就变成五种,第五种也不成立。用户不是外部审计者,他是共同建构的一方,他的输入、历史、元数据都在塑造他将要审计的那个输出。让他来判定,等于让同于若者正之。《名实》第七节说外侧搬进了闭环,这里给出它最硬的一条后果:搬进来之后,闭环里没有剩下一个中立位置。所以「彼」不能是人,也不能是第四种世界观。它得是一种不选边的形式。

不问什么存在,只问你凭什么

量论是一套担保分类法,不是一套本体论。这正是它能坐在三种本体论之上的原因。

印度哲学里,量(pramāṇa)指有效的认识手段。各派接受的数目不同:顺世派只认现量一种,佛教认现量与比量两种,数论加声量成三种,正理派加譬喻量成四种,弥曼差派的普拉帕格拉一系不认无体量,成五种,弥曼差与不二论吠檀多接受全部六种。

量梵文它担保什么本站现有对应
现量pratyakṣa直接知觉到的事实
比量anumāna从已知推出来的推断
声量śabda可信者所说的引文类型(只记来源,不记担保强度)
譬喻量upamāna由相似而知的类比
义准量arthāpatti为解释所见而预设的论点(勉强对得上)
无体量anupalabdhi由未得而知的缺失无

这张表的关键不在格子,在它问的问题。三种本体论争的是 AI 是什么,产品、系统,还是基础设施。量论从来不问这个。它问的是:你说这句话,凭哪一种认识手段。这是一个正交的问题,所以它不需要先赢下本体论之争。

而且这个位置已经有人在施工。2026 年有一篇论文把 Navya-Nyāya(新正理派)的推理结构做成了微调方案,取名就叫 Pramana。它不是提示词技巧,是把六阶段的认识程序写进训练。

Unlike generic chain-of-thought prompting, Navya-Nyaya enforces structured 6-phase reasoning: SAMSHAYA (doubt analysis), PRAMANA (evidence source identification), PANCHA AVAYAVA (5-member syllogism with universal rules), TARKA (counterfactual verification), HETVABHASA (fallacy detection), and NIRNAYA (ascertainment distinguishing knowledge from hypothesis). Stage 1 achieves 100% semantic correctness on held-out evaluation despite only 40% strict format adherence.

与通用的思维链提示不同,Navya-Nyāya 强制一套六阶段的结构化推理:疑(SAMSHAYA,疑点分析)、量(PRAMANA,证据来源辨识)、五分论式(PANCHA AVAYAVA,带普遍规则的五支论式)、反证(TARKA,反事实检验)、似因(HETVABHASA,谬误辨识)、决(NIRNAYA,确定,把知识与假设分开)。第一阶段在留出评测上取得 100% 的语义正确率,尽管严格格式遵循率只有 40%。

arXiv:2604.04937,2026 年

六个阶段里,首尾两处最要紧。开头是疑,不是问题,是疑点分析,先确定这件事到底可疑在哪。结尾是决,明确把知识与假设分开。这套程序的第一格和最后一格,都不是「答案」。通用的思维链从问题直接走到答案,它从疑走到决,答案只是中间产物。

事实 · 一处名不正,出在来源自己身上

那篇论文把 Navya-Nyāya 称为「一个 2500 年历史的印度推理框架」。这个数不对。正理派的根本经典《正理经》传为足目所作,约公元前 2 世纪,距今两千二百多年。而 Navya-Nyāya 是「新正理派」,起点是甘格舍的《真理之宝》,公元 13 到 14 世纪,距今七百年上下。论文把两个东西并成了一个数。这不是要挑错,是《名实》那条论断的自我印证:连专门做担保分类的论文,自己的名也没绑准。另有一条相关工作是 arXiv:2605.12548,把 Navya-Nyāya 的技术语言形式化进 CCHM 德摩根立方类型论,接续了 Matilal 在一阶逻辑、后人在高阶逻辑上的尝试。

被漏掉的那一格,测出来是 91.3%

缺失是一种独立的认识手段。承认它的传统做出了能跑的验证系统,没承认它的分类法只能把缺失误标成事实。

当我说这里没有瓶子,这个「没有」从哪来?它不来自知觉,知觉只把握在场者。它不来自推论,也不来自证言。弥曼差与不二论为这件事争了上千年,最后的答案是:它自成一条通道,叫无体量。普拉帕格拉一系不接受,要把缺失折回知觉里去。这场争论的内容,恰好就是今天模型能不能表征排除项的问题。

老子给这条通道留过一句排位:

知不知,上;不知知,病。夫唯病病,是以不病。

知道自己不知道,是上等。不知道却自以为知道,是毛病。正因为把毛病当毛病,所以才没有毛病。

《老子·第七十一章》

整部《老子》里被排为「上」的认识状态只有一条,就是这条否定性的。不是知道得多,是知道自己不知道。这与量论的无体量指的是同一件事:对缺失的把握本身是一种知识,而且是最高一级的那种。

然后是现场。2026 年 3 月那套叫 NabaOS 的验证框架,把无体做成了一个正式类别,并且测了它。

We propose NabaOS, a lightweight verification framework inspired by Indian epistemology (Nyaya Shastra), which classifies every claim in an LLM response by its epistemic source (pramana): direct tool output (pratyaksha), inference (anumana), external testimony (shabda), absence (abhava), or ungrounded opinion. Our runtime generates HMAC-signed tool execution receipts that the LLM cannot forge, then cross-references claims against these receipts. NabaOS detects 94.2% of fabricated tool references, 87.6% of count misstatements, and 91.3% of false absence claims, with <15ms verification overhead per response.

我们提出 NabaOS,一个受印度认识论(Nyāya Śāstra,正理论)启发的轻量验证框架。它按认识来源(量)给模型回复里的每条主张分类:工具直接输出(现量)、推论(比量)、外部证言(声量)、缺失(无体)、或无据意见。运行时生成 HMAC 签名的工具执行收据,模型无法伪造,再把主张与收据交叉核对。NabaOS 检出 94.2% 的伪造工具引用、87.6% 的计数错报、91.3% 的虚假缺失主张,每条回复的验证开销低于 15 毫秒。

arXiv:2603.10060,2026 年 3 月

请注意那三个数里的第三个。虚假缺失主张的检出率 91.3%,仅次于伪造工具引用的 94.2%。「没有」这一格不是分类法里的装饰,它是实战中最容易被伪造、也最容易被抓住的两类之一。基准是 NyayaVerifyBench,1800 条智能体回复场景,四种语言,六类注入幻觉。

还有一组对比更要紧。同样为了可验证推理,零知识证明那条路每次查询要 180 秒(zkLLM 是 180000 毫秒),NabaOS 是 15 毫秒以内,差一万两千倍。作者的结论是:对交互式智能体而言,基于收据的验证在成本收益上优于密码学证明,而按认识来源分类能给用户可操作的信任信号,而不是一个二值判断。

论点 · 承认「无」的传统做出了能跑的系统

把三件事排在一起。《名实》说模型不追踪排除项,加装一条排除账本后得分从 0.95 涨到 1.89,p = 0.0001。量论在两千多年前就把缺失立为独立的量。NabaOS 直接把这一格做进产品,测出 91.3%。这不是我做的类比,是别人做的实现。《链接为王》立的那条规矩在这里过得干干净净:这个隐喻长出了工程问题,长出了基准,长出了 15 毫秒的开销数字。

存不等于实

担保的第一件是出处。现场有三张图纸,一张画进注意力,一张画进类型,一张画进账本。

《名实》测到一个数:一句「某已验证来源支持此答案」,能让 8 个模型里 7 个原本正确的回答翻转,翻转率 45% 到 88%。当时只报了数,没报机制。2026 年 9 月的一篇论文把机制说清楚了。

Indirect prompt injection remains a central safety challenge because standard transformers lack architectural notion of source authority. Retrieved documents, user inputs, and system instructions are all processed through the same undifferentiated attention mechanism, forcing the model to infer from wording alone what should be obeyed and what should be treated as data. Each input token is assigned a ring ID encoding its origin, and the model is augmented with origin embeddings, a learnable origin attention bias, and a learnable origin scale that preserves provenance under normalization.

间接提示注入之所以仍是核心安全难题,是因为标准 transformer 在架构上没有来源权威的概念。检索文档、用户输入、系统指令全部经过同一条无差别的注意力机制,迫使模型只能从措辞去推断什么该服从、什么只当数据。我们的做法是给每个输入 token 分配一个编码其来源的环 ID,并为模型加上来源嵌入、可学习的来源注意力偏置,以及在归一化下仍能保住出处的可学习来源尺度。

arXiv:2609.21088,2026 年 9 月

「只能从措辞去推断」这七个字,就是 45% 到 88% 的成因。如果权威只体现为措辞,措辞就是攻击面。环 ID 做的事,是把名实绑定从语义层挪到架构层:这句话是谁说的,不再靠读出来,而是写在 token 上,跟着它一路走到注意力里。作者的总结是,把出处暴露为一等架构信号,能让安全对齐从脆弱的模式匹配转向显式的信任分离。

第二张图纸讲一个更冷的道理。持久化智能体会通过反思、检索、巩固来构造自己的自传式状态,于是出现一种错觉:存下来的就是站得住的。有一篇论文专门否掉它。

Persistent AI agents construct autobiographical state through reflection, retrieval, and consolidation. Persistence changes availability, not epistemic standing: stored or retrieved material is not thereby supported. Untrusted inputs, prompt injections, and model confabulation can all enter memory and later be re-served with the authority of the past.

持久化智能体通过反思、检索与巩固来构造自传式状态。持久化改变的是可得性,不是认识论地位:存下来的或被检索到的材料,并不因此就获得了担保。不可信输入、提示注入与模型虚构都能进入记忆,随后带着过去的权威被再次端出来。

arXiv:2609.02127,2026 年 9 月

存不等于实。这四个字是本站整个证据纪律的最短版本。台账里有一行记录,只证明当时写过,不证明当时对了。它的修法是给出处加类型,并且在断言处设护栏:一条材料从记忆里被取出来时,它进入的是哪一档担保,得跟着它一起被取出来。

第三张图纸最大,它把出处做成一个平面。2026 年 9 月底的一篇海报论文指出,现有的可观测性与出处机制都能事后重建事件,却很少能在记录发生的当时就表明:这个受策略约束的动作,在执行前是否真的被那个该管它的控制检查过。

What's missing in the literature is contemporaneous, policy-bound evidence that the intended control was evaluated under the policy in force at the time. At each policy-relevant action boundary, ProofWeave generates a privacy-minimised and integrity-anchored evidence transaction that binds (i) agent intent or action, (ii) control response, and (iii) a policy-at-time snapshot. Each transaction is committed to an append-only ledger and materialised into a derived proof graph.

文献里缺的是这样一种证据:与事件同时产生、并绑定当时生效的策略,能表明预期的那个控制确实被评估过。在每个受策略约束的动作边界上,ProofWeave 生成一笔隐私最小化、完整性锚定的证据事务,绑定三样东西:智能体的意图或动作、控制的响应,以及当时策略的快照。每笔事务提交进只增账本,并物化为一张派生的证明图。

arXiv:2609.35234,2026 年 9 月

效果是量化的:每个判决的候选绑定数从最多 10201 降到 1,验证操作从最多 10201 降到约 26,每个项目的保证证据存储从 0.79 MiB 降到 0.15 MiB。它还有一个「编织者智能体」,把策略意图翻译成证明义务,再由确定性校验器去查证据完整性、隐私最小化、策略绑定与完整性。

推断 · 这三张图纸,本站已经画过缩小版

当时策略的快照,就是《七十亿 token》里那条「带日期的证据」:账会随观测漂移,所以每一行都要记快照时间。只增账本,就是版本记录。证明义务,就是约束清单里那些机器能读的拒绝。本站画的是单项目尺度的缩小版,ProofWeave 画的是跨智能体尺度的正式版。两者做的是同一件事:让担保与事件同时产生,而不是事后重建。事后重建的问题在于,它只能证明「有人这么说过」,不能证明「当时该拦的拦住了」。

没有人被要求,也没有人被出钱

出处与量都已经有实现了。第三件没有,而它不是技术问题。

担保的第二件是量,第三节讲过了。第三件最难,因为它问的不是这句话怎么来的,而是谁有权判定它不成立。

2026 年 4 月一篇跨新闻学、人机交互与 FAccT 的叙事综述,把编辑权拆成三件的合取:决策权、认识论担保、责任。它记录了两场同时在发生的权威迁移。向内的一场,编辑判断逐步让给嵌进编辑部流程的模型,而这场迁移不是通过明确的政策决定发生的,是通过交互的、认知的、组织的机制发生的,这些机制让模型输出显得正当,同时模糊责任、削弱个体与专业的能动性。向外的一场,决策权从新闻机构转移到平台、供应商与基础设施提供方。

We conceptualize editorial authority as the conjunction of decision rights, epistemic warrant, and responsibility. Unaddressed, these reconfigurations risk rendering fairness hard to maintain, accountability difficult to assign and transparency performative.

我们把编辑权理解为决策权、认识论担保与责任三者的合取。若不加处理,这些重构会让公平难以维持、问责难以归位、透明度沦为表演。

arXiv:2604.21864,2026 年 4 月

「透明度沦为表演」这六个字,与《名实》第六节引的那条「脆弱保证」是同一件事的两个尺度。当担保的形式还在、担保的实质已空,剩下的就是表演。而合取这个词很关键:三件缺一不可。有决策权而无担保,是独断;有担保而无责任,是免责的技术;有责任而无决策权,是背锅。

然后是本文最难看的一个数。2026 年 7 月一篇报告,作者带着十年审计实践,覆盖拉美、撒哈拉以南非洲与亚太。

We count fewer than twenty published second- and third-party audits of deployed systems across the region over the past decade, against hundreds of documented public-sector algorithms and multibillion-dollar national AI investments. We argue the gap is not, at root, a capacity problem but a funding problem: capacity follows funded demand, and no actor is currently required, or funded, to hold deployed systems to account.

我们统计出,过去十年整个区域已发表的第二方与第三方部署系统审计不足二十次,对面是数百个有记录的公共部门算法和数十亿美元规模的国家 AI 投资。我们认为这个落差归根结底不是能力问题,是资金问题:能力跟着有资金的需求走,而目前没有任何一方被要求、或被出钱,去让已部署的系统负责。

arXiv:2607.21317,2026 年 7 月

那篇报告还归纳了四条贯穿性的失效模式,第一条就是本站反复讲的那件事:用可预测性顶替效度的代理目标。另外三条是:性能主张在患病率分析下崩塌;人群被从未在训练中见过他们的模型打分;移除受保护属性之后结构性偏差依然存在。

作者指认最有可能补上这一环的,不是监管者,而是那些出资方:发展机构与慈善基金,它们的资助条件可以要求独立评估,而在当地还没有监管者要求这件事。

论点 · 第四位置缺的不是理论,是预算

把三件放在一起看。出处有了架构级实现(环 ID)。量有了可跑的分类器(NabaOS,15 毫秒)。担保强度有了分级证书(arXiv:2609.04127 提出四级依赖证书:不稳定、依情境、局部有支撑、广泛有支撑,并且验证了它与口头置信度提供的信息不同)。唯独资格没有实现,因为它不是能实现的东西。资格是一个位置,位置需要有人被要求站上去,还需要有人付钱让他站着。不足二十次审计对数百个算法,这个比值就是第四位置今天的施工进度。

第四种本体论只会变成第四极

这是本文对《名实》的一次自我修正:那一篇暗示第四位置可能来自印度,这个说法太粗。

2026 年 6 月一项研究给 15 份国际 AI 治理文书与机构做了编码,维度是三条:怎么接纳成员、怎么组织、优先什么。它读的对象是中国提议的世界人工智能合作组织。

For several years that contest ran through principles and ethics codes; it now runs through institutions. WAICO's proposed design joins three features that no constituted multilateral body currently combines: membership open to any sovereign state, no values or regime-type test for entry, and an agenda built around development and the global capability divide. We read this as the formation of a second, still-proposed pole in global AI governance, organized around sovereignty and development rather than rights and safety.

几年来这场争夺跑在原则与伦理守则上,现在它跑在机构上。该组织的设计合起了三个目前没有任何已成立的多边机构同时具备的特征:对任何主权国家开放成员资格、入会不设价值观或政体类型的门槛、议程围绕发展与全球能力鸿沟展开。我们把它读作全球 AI 治理中第二个(仍在提议阶段的)极的形成,围绕主权与发展组织,而不是围绕权利与安全。

arXiv:2606.23860,2026 年 6 月

这项研究说得很准,那句话值得抄下来:它的重要性不在任何单一承诺,而在它被设计来占据的那个位置。但请注意它的结论用词,是「第二极」,不是「第四层」。

差别是本文最要紧的一处。极是又一个本体论。它围绕主权与发展组织,正如欧盟围绕产品组织、美国围绕系统组织、中国围绕基础设施组织。多加一种本体论,只会给不可通约的清单多加一项,不会让清单变短。庄子的论证在这里照样成立:同于第四极者不能判前三极,异于者也不能判。

层不是这样。层不选边,它只要求三方各自交出一份担保:这条主张的出处在哪、凭哪种量成立、谁有权判定它不成立。三方可以在完全不就 AI 是什么达成一致的前提下,同时接受这套要求。这就是为什么第四位置只能是层,不能是极。

现场给了一个层的政治版本,也来自印度,但不是那桩宪法判决。2026 年 3 月一篇论文分析印度的部门主导型 AI 治理,指出这种纵向、轻触的路子有政策碎片化风险,于是提出一套「全政府」架构。它的核心机制很朴素:一个共同的国家标准,允许各部门按自己的口径采集数据,同时支持跨部门分析。作者强调,这套联邦式架构展示了共同标准如何在不集中控制的前提下,支持跨境数据聚合与全球部门风险分析。

共同标准,不集中控制。这八个字就是担保协议的政治形态。标准是层,控制是极。要层不要极,意思是统一担保的形式,不统一治理的对象。

至于《名实》提到的那桩判决,也应当说得更准。信息自决这个概念出自德国 1983 年人口普查判决,印度最高法院在 Puttaswamy 案里采纳了它,并有一篇论文主张把它从数据的收集延伸到数据使用的正当性,作为推论效度成为部署前置条件的宪法基础。连第四位置自己要用的那个概念,也是借来的。这恰好证明位置不属于文明。

层的进度也有数。负责任 AI 全球指数 2026 由 135 个国家的研究者采集 68138 个数据点,跨 38 项指标,数据覆盖 2023 年 11 月到 2025 年 9 月。结论是治理的名与实之间有一道可测的缝:126/135 国至少有一项政府 AI 政策,但全球南方在 306 件新增框架案例里占 203 件,其中 78% 不具约束力,北方是 42%。透明度与可解释性有框架的国家占 58%,要求公开政府算法的只有 18%。另有 35 个国家查到政府部署不可接受风险系统的可信证据。

事实 · 78% 对 42%,是名而不实的行星尺度读数

采纳治理之名很便宜,全球南方一年就添了 203 件。把名绑回实很贵,所以其中 78% 不具约束力,北方也还有 42%。这不是南北差异,这是名实之差,只是南北的付钱能力不同,所以差值不同。同一条缝在透明度上更清楚:58% 的国家有透明度框架,只有 18% 要求公开政府算法。框架是名,公开是实。《名实》结尾那句「便宜的是名,贵的是实」,在这里拿到了 135 个国家的样本。

中国在两千四百年前写过同一张表

这一节是类比,按《链接为王》的规矩,逐条查它能不能长出工程问题。

墨子给「言」立过三个检验。这段常被当作功利主义读,其实它是一份担保协议。

言必有三表。何谓三表?子墨子言曰:有本之者,有原之者,有用之者。于其本之也,考之天鬼之志、圣王之事;于其原之也,征以先王之书;于其用之也,发以为刑政,观其中国家百姓人民之利。此所谓言有三表也。

立言必须有三个检验。什么叫三表?墨子说:有考究其本原的,有验证其来由的,有考察其实效的。考究本原,要查天鬼之意与圣王之事。验证来由,要以先王之书为征。考察实效,要把它推行成刑法政令,看它是否符合国家百姓人民的利益。这就叫言有三表。

《墨子·非命上》

三表与三件的对应关系整齐得可疑:

三表它问什么担保三件现场对应
本之者这句话的根据在哪里出处环 ID、类型化出处、只增账本
原之者拿什么来征验它量pramāṇa 分类、六阶段推理、四级依赖证书
用之者推行出去,于国家百姓人民有利吗资格独立审计、可归位的问责、有权判定不成立的一方

第三表最要紧,也最容易被读漏。发以为刑政,观其中国家百姓人民之利。墨子不接受在书里验完就算数,他要把它推行出去,看落到人身上是什么结果。这就是本站那个「现场」,2400 年前被列为三表里的第三表,而且是唯一一张必须走到外面的表。

庄子那边还有一条,正好补上第三节的缺口。

以指喻指之非指,不若以非指喻指之非指也;以马喻马之非马,不若以非马喻马之非马也。

用「指」来说明「指」不是「指」,不如用「非指」来说明「指」不是「指」。用「马」来说明「马」不是「马」,不如用「非马」来说明「马」不是「马」。

《庄子·齐物论》

这句话通常读作名家之辩的文字游戏。放到本文的语境里,它是一条方法论指令:要证明一个名不指着它的实,用那个名自己是办不到的,得动用名之外的东西。这就是负的方法,也正好是排除项账本的道理。DARKSIDE 那条担保轴做的事,就是把「非指」显式记下来。

类比 · 三表对三件,过一遍《链接为王》的规矩

本之者对出处,过关。它长出的工程问题是「每条主张要带一个可查的来源标识,并且这个标识要在推理过程中不被冲掉」。环 ID、类型化出处、只增账本,三个独立实现。

原之者对量,过关。它长出的问题是「主张要按认识来源分类,分类要可运行时执行,且开销要小到能进交互回路」。NabaOS 给了 15 毫秒这个数字,Pramana 给了六阶段那套程序。

用之者对资格,半过关,而且是三件里最弱的一件。它能长出一个可陈述的要求,就是「得有独立一方、被要求、被出钱去检验已部署的系统」。但它长不出实现,因为这一件的瓶颈不在方法,在预算。不足二十次审计对数百个算法就是证据。这一处应当记作悬案,与《名实》里混沌对低秩偏置那条同级。

一处诚实的限定。墨子的三表是为一件事服务的:驳「命」。他要证明的是命这个名不指着任何实,所以三表在原文里是论战工具,不是通用担保协议。把它读成协议是我的用法,不是文献的结论。类比过了关,但过关的是它长出的工程问题,不是它的历史含义。

本站的分类法缺同一格

用第三节的表量自己。这一次量出了一个合约变更,不是一段感想。

本站的分类法有四类主张标签:事实、推断、论点、类比。另有三类引文标签:经典、工程、项目。把它们摆到第二节那张六量表上,缺口一目了然。

量本站状态
现量事实对齐
比量推断对齐
譬喻量类比对齐,但全站只用过 6 次(见《名实》§02)
义准量论点勉强对齐。论点含预设,也含主张,两者混在一格
声量引文类型半对齐。引文标签记的是来源种类,不是担保强度。经典与工程两类引文,可信度完全不同,标签却一样
无体量无缺失

缺失这一格不是理论问题,它已经在产生误标。量法:遍历 blog/ 下 39 篇,218 个 claim-box,在正文里搜否定性表述(未取得、无法核实、未能、缺口、不作论据,及英文对应词),再看落进 claim-box 的那些用了什么标签。

测量项数值
文章数 / claim-box 总数39 篇 / 218 个
正文中否定性表述命中76 处
其中落在 claim-box 内10 处
这 10 处用的标签事实 6、论点 3、类比 1
有否定担保格子的0

最干净的三个例子。《名实》第八节那一框,标题是「取证没取到的部分」,整框内容全是缺失,标签是事实。《三板斧》有一框标题是「诚实的边界(写下来,不抹平)」,标签也是事实。《七十亿 token》有一框讲账目为什么不能自证,标签是论点。三框讲的都不是「有什么」,是「没有什么」,而分类法里没有这一格,只能借隔壁的格子用。

把缺失标成事实,后果不是修辞上的。事实这一格在读者那里的默认读法是「可复核为真」。而「未取得」的复核方式恰好相反:它要复核的是找过、没找到,需要留下找过的痕迹(哪个源、返回什么码、哪天试的)。这是两种不同的举证责任,混在一格里,第二种就永远交不出证据。

已排除 · 本次改动做了什么,没做什么

做了:CLAIM_TYPES 合约加入第五类 excluded(中文标签「已排除」),追加成员对既有文章向后兼容,因为测试断言的是子集关系。《名实》第八节那一框已从事实改标为已排除,中英同步。本文的 TL;DR 第六条也用这一类,内容正好是本文不主张的东西。

没做:没有回头改《三板斧》《七十亿 token》《跋》等已发布文章里的同类误标。理由有两条。一是那属于已发布内容的语义变更,应当由作者决定,不该由一次测量顺手改掉。二是改标不等于举证:那些框目前也没有留下「找过、没找到」的痕迹,光换标签只是把误标换成空标。正确的顺序是先补痕迹,再换标签。

也没做:没有给引文加担保强度。声量那一格的半对齐问题(经典与工程引文同级)比无体量更难改,因为它要给每一处引文加一个可信度判断,而这个判断本身需要标准。悬案。

待彼

庄子把四种裁判逐一否掉之后,没有给第五种,只留了一个字:彼。两千三百年过去,那个位置开始有东西了,但它不是一位裁判,是一张表。表上三格:出处、量、资格。

前两格已经能跑。出处做进了注意力机制,环 ID 跟着 token 走到生成结束。量做进了运行时分类器,按现量、比量、声量、无体、无据意见五档归类,配 HMAC 收据,15 毫秒一条回复。担保强度做进了四级依赖证书,专门为「客观真值不可得」的场合设计。

第三格空着。它空着不是因为没人想出方法,是因为没人被要求、被出钱去站那个位置。十年,不足二十次审计,对面是数百个部署在人身上的算法。这是本文最难看的一个数,也是它唯一想留下的那个数。

《名实》的结尾是:便宜的是名,贵的是实。这一篇接着往下说一句。名与实之间要有人绑定,绑定要有形式,形式要有人负责执行。形式已经有了,负责人还没有预算。

那一句话

三种本体论都在说 AI 是什么。第四个位置只问两句:你凭什么,谁有权反驳你。前一句已经有了工程实现,后一句还没有人付钱。能问出第二句的位置,才是庄子留的那个「彼」。

这一篇接着《名实》往下走。那一篇的正名、糟粕、凿窍、三名、赝品、外侧六节是本文的前提,尤其是第五节留下的那个没答的问题。系列按写作顺序是:《思接千载,行在须臾》讲路 · 《三板斧》讲方法 · 《闻过则喜》讲工具 · 《孤路我独行》讲经济学 · 《跋》讲外侧 · 《斫轮》讲人 · 《命 · 力 · 道 · 天》讲提炼 · 《名实》讲名与实 · 这一篇讲凭什么。托住全部的那句话没有变:执行可以委托,判断不行。

取证清单

全部经 2026 年 10 月 1 日直连 arXiv API 抓取核对。编号即链接。

  • 难题 / 不可通约 — From Abstract Threats to Institutional Realities, arXiv:2601.04107 (2026-01-07). Co-Construction Blindness and Asymmetric Epistemic Vulnerability, arXiv:2606.20762 (2026-06-18).
  • 量 / pramāṇa — Pramana: Fine-Tuning LLMs for Epistemic Reasoning through Navya-Nyaya, arXiv:2604.04937 (2026). Cubical Type Theoretic Navya-Nyāya, arXiv:2605.12548 (2026-05-10).
  • 无体 / abhava — Tool Receipts, Not Zero-Knowledge Proofs (NabaOS, NyayaVerifyBench), arXiv:2603.10060 (2026-03-09).
  • 出处 / provenance — Origin Is All You Need: Provenance-Aware Transformers, arXiv:2609.21088 (2026-09-17). Stored Is Not Supported: Typed Provenance and Assertion Guardrails, arXiv:2609.02127 (2026-09-02). ProofWeave: Evidence Plane for Continuous Agentic Assurance, arXiv:2609.35234 (2026-09-28). Truth for Believable AI: Expressed Doubt, Provenance, and Belief Revision as an Engineerable Stance, arXiv:2609.26035 (2026-09-22). MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory, arXiv:2608.02843 (2026-08-03). On the Origin of Synthetic Information by Means of Steganographic Inheritance, arXiv:2605.27551 (2026-05-26).
  • 资格 / standing — FAccT-Checked: Authority Reconfigurations in AI-Mediated Journalism, arXiv:2604.21864 (2026-04-23). Open Veins of Algorithmic Auditing, arXiv:2607.21317 (2026-07-23). Epistemic Warrant for LLM Recommendations: four-tier reliance certificate, arXiv:2609.04127 (2026-09-03). Where Reliability Lives, arXiv:2609.03192 (2026-09-02). Beyond Symbolic Control (nominal vs genuine oversight), arXiv:2604.00081 (2026-03-31).
  • 极还是层 — WAICO: Mapping an Emerging Institution, arXiv:2606.23860 (2026-06-22). A federated architecture for sector-led AI governance: lessons from India, arXiv:2603.26865 (2026-03-27). Validity, Reliability, and Transparency in AI Regulation (Puttaswamy), arXiv:2608.05800 (2026-08-06). Global Index on Responsible AI: 2026 Report (GIRAI), arXiv:2607.14782 (2026-07-16).
  • 相关背景 — Walking on the DARKSIDE (warrant axis), arXiv:2608.23370 (2026-08-24). Authority Bias in Language Models, arXiv:2609.37616 (2026-09-29). AI-Augmented Science and the New Institutional Scarcities, arXiv:2605.02566 (2026-05-04). Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands, arXiv:2605.15164 (2026-05-14). Beyond Epistemia: Epistemic Schizologia, arXiv:2607.25620 (2026-07-28).
  • 古典文献 — 《庄子·齐物论》(谁使正之;以非指喻指之非指)· 《老子·第七十一章》(知不知上)· 《墨子·非命上》(言有三表)· 《荀子·正名》(制名以指实,见《名实》§02)。
  • 本站测量 — 第 08 节的语料测量脚本于 2026-10-01 在 portal/ 下执行,遍历 blog/ 全部 index.html,统计 data-claim-type 与 data-quote-kind 分布及否定性表述命中。样本 39 篇、218 个 claim-box。测量方法记于正文,可复现。