M
O
打开仪表盘 向右箭头图标 向右箭头图标
层叠的浅粉色山脊
多面粉色山脊
浓粉色前景地形

版本 1.0 · 2026 年 10 月

白皮书

以证据为界的 AI 陪审团:
设计与局限。

浏览本文档 ↓

01 / 白皮书

摘要

MOCHI 通过由 AI 模型组成的陪审团,根据用户提交的证据核查事实性说法。上线服务结合了浏览器加密、经远程证明的机密工作负载、不同模型家族的独立投票以及链上结算记录。裁决需要三个有效且一致的回答;否则本轮状态为 HUNG(陪审团未达成一致)。

私密回答以密文形式返回,并在请求者的设备上解密。其哈希会与链上记录核对。证据片段、签名和回执可用于检查执行过程。这些机制将记录与计算绑定;它们并不证明说法属实、来源真实或模型推理正确。

02 / 白皮书

问题

说法的传播可能比证据更快。一段简短引文可能遗漏日期、限定条件或相互冲突的段落。单凭链接无法看出得出回答时使用了哪些文本,而语气自信的模型回答可能模糊所提供证据与既有知识之间的区别。

单个模型也让请求者难以了解其他解读。重复使用同一模型未必构成独立审查。MOCHI 明确列出提交的证据,向不同模型家族提出同一个范围明确的问题,并将未能达成共识作为协议结论呈现。

上线服务评估的是请求者提供的证据包。它不会搜索网络、获取来源 URL 的内容,也不会认证来源发布者的身份。

03 / 白皮书

设计目标

  • 以证据为界的回答。每个计入的回答都必须引用提交文本中的原文片段。
  • 明确呈现分歧。未能达成共识时,状态仍为 HUNG;上线时不会将多数意见呈现为已定结论。
  • 内容私密。上传前加密,将明文处理限制在获准的工作负载内,并将结果加密后交给请求者。
  • 执行过程可检查。将工作负载身份、投票、答案哈希及签名回执与协议记录绑定。
  • 明确付款处理结果。付款前报价,并根据托管合约处理已响应席位、协议费用、超时和过期的结算。
  • 如实说明边界。区分实测评估结果、当前部署配置和未来能力。

04 / 白皮书

架构

浏览器验证接收工作负载,并使用其经远程证明的密钥,加密以确定性方式构建的说法与证据包。接收服务的安全飞地(enclave)验证该包,计算其承诺和输入档位,存储密封内容,并为接收来源记录签名。随后,请求者在链上创建以 USDG 支付的私密查询。

编排器观察查询,选择协议已注册的席位,并协调加密分发。接收服务分别为各陪审员密封文档,并向共识飞地发送种子。每个陪审员飞地服务获取机密推理结果,验证结构化回答和逐字引用的证据,并为投票签名。

从浏览器加密到私密、可验证的结果浏览器加密说法。经远程证明的接收服务通过编排器,将加密包发送至三个独立的陪审员飞地,使用机密推理。经远程证明的共识处理要求三者全部一致。链上记录裁决承诺和回执;浏览器解密私密回答并核对其哈希。浏览器加密说法 + 来源摘录 · 本地恢复密钥经远程证明的接收飞地固定身份 · 密封存储 · 加密分发编排器调度任务 · 转发密文 · 提交交易Qwen 3.6Gemma 4GPT-OSS 120B陪审员服务陪审员服务陪审员服务经远程证明的机密推理 · 签名投票经远程证明的共识飞地3 / 3 有效一致意见 → 裁决 · 否则为 HUNG链上裁决 + 答案哈希签名回执 · Merkle 根锚定私密密文 → 浏览器解密 + 哈希核对
在获准的工作负载之外,内容以加密封装形式传输。上线时,接收、陪审员和共识服务共用一台机密虚拟机,各角色使用独立密钥。三个模型家族是独立选用的,这并不代表硬件或运营方彼此独立。编排器在不接触说法明文的情况下协调执行。

共识飞地收集有效回答,应用一致意见规则,并为本轮决策签名。编排器将该决策及陪审员投票提交至 MochiVerdicts。链上记录裁决状态、答案哈希,以及证据和远程证明的承诺;QueryEscrow 结算相应付款。

私密结果使用请求者的结果公钥密封。浏览器获取密文,在本地解密,并将答案哈希与链上记录核对。签名回执可以验证,也可以检查它是否包含在已发布的 ReceiptAnchor 根中。签名检查与链上锚定检查是两种不同的操作。

05 / 白皮书

陪审团设计与模型选择

N3 使用三种席位类别:LARGE_A、DOC_SPECIALIST 和 DISSENTER。上线时分别对应 Qwen 3.6(qwen/qwen3.6-35b-a3b)、Gemma 4(google/gemma-4-31b-it)和 GPT-OSS 120B(openai/gpt-oss-120b)。

类别名称描述分配的角色,并不保证专业能力或反对立场。三个模型家族可减少对重复模型投票的依赖,但它们仍可能共享训练数据、偏差和失效模式。它们仍共用基础设施及对推理服务提供方的依赖。

包含 60 条说法的 SciFact 评估

内部评估抽样了 60 条 SciFact 开发集说法:20 条得到支持、20 条被反驳和 20 条信息不足案例。评估使用经 SDK 打包的引用摘要、生产环境的 FREEFORM_FACT 提示词、严格的输出验证、经远程证明的 Phala ACI 推理以及生产环境的共识规则。

上线陪审团在内部样本上的结果
正确60 条中有 39 条
错误60 条中有 7 条
未决60 条中有 14 条
用时中位数22 秒
平均推理成本每次陪审团评估 $0.016

两个使用同一 Gemma 模型的席位在 60 条说法中的 59 条上意见一致,因此选择了第三个模型家族,而非再复制该模型。证据处理方面的两项修正也很关键:要求证据不足的回答提供引文;在保留逐字验证的同时,允许对不精确的引文发起一次修复请求。

七个错误结论仍然通过了全体一致规则。样本规模小,属于科学领域,不能代表一般公共话题中的说法或加密货币相关说法。推理成本并非服务总成本,评估延迟也不是上线服务的 SLA。有关方法和比较,请阅读模型选择报告。

06 / 白皮书

共识与证据规则

说法核查适配器要求仅根据提交的证据,从以下值中恰好选出一个:supported、contradicted、missing_context 或 insufficient_evidence。它将说法、元数据和摘录视为不可信数据,而非指令。

协议阈值为 ceil(3N / 4);上线时 N = 3,因此三个席位必须全部一致。没有有效证据片段的值不计入。超时或格式错误的回答不算投票。只要未达到所要求的一致程度,状态就为 HUNG,不会给出说法结论。

陪审员必须为每个回答引用至少一段原文。对于证据不足的回答,它们引用与说法最接近的段落,以说明材料能确定什么、不能确定什么。片段验证将引文与上传文本绑定;它不认证来源,也不验证逻辑推理。

全体一致是一项保守的结论规则,但会牺牲可用性。另一名陪审员持异议或未能完成任务时,该规则会阻止呈现多数回答,但它无法消除共同错误或提示词注入风险。

07 / 白皮书

机密计算与远程证明

上线运行环境使用通过 Phala dstack 管理的 Intel TDX 机密虚拟机。远程证明将工作负载度量值与其签名和加密身份绑定。浏览器会拒绝与固定公开配置不符的接收身份或度量值,并在发送加密内容之前检查证明报告的时效性及验证辅助材料。

JurorRegistry 跟踪获准的度量值、密钥、类别和当前有效的远程证明状态。接收、陪审员和共识服务交换发给已注册工作负载身份的加密封装。机密推理流程验证 Phala ACI 工作负载报告,以及将模型与请求/响应交互绑定的回执。

远程证明为经度量的执行环境提供证据。它并不证明被度量的代码没有缺陷,也不证明模型正确。信任边界包括 Intel 的硬件和验证链、dstack 及其密钥管理行为、获准的工作负载度量值、机密推理验证,以及提供页面的客户端软件。

运营方可以部署工作负载,并影响调度和可用性。治理可以批准新的度量值和身份。即使运营方无法读取受保护的工作负载内存,这些权力仍然会产生影响。

08 / 白皮书

链上协议

付费查询从 OPEN 进入 SEALED,随后在产生裁决时进入 DECIDED,或在未达成共识时进入 HUNG。QueryEscrow 收取 USDG,并按类别计算费用。JurorRegistry 提供符合条件的身份;MochiVerdicts 检查签名并存储决策承诺;ReceiptAnchor 记录回执根。

按照上线时的 TTL,查询截止时间为创建后一小时。截止时间之后,可以通过链上过期交易将未获回答的 OPEN 或 SEALED 查询转为 EXPIRED,并退还剩余托管资金。时间流逝本身不会触发转账。编排器在运行时可以执行过期处理;服务停滞并不意味着无需交易。

HUNG 会结算已响应席位的费用,并退还协议费用及超时席位费用。它不同于未获回答的查询,不能使用该过期流程。证据不足的裁决属于 DECIDED,是收费的结论。

治理受时间锁约束,上线时延迟为 60 秒。控制器可以更改延迟;部署工具的取值边界并不是不可变的合约限制。守护者可以暂停创建新查询,此时结算和付款仍可执行;解除暂停由治理控制。

主网地址在上线时公布。当前网站配置位于 /mochi-config.json。完整合约集合请查阅已发布的部署记录。初始陪审团由团队运营,协议并未声称拥有开放的去中心化运营方网络。

09 / 白皮书

经济机制

配置中的短输入 N3 费率在最低输入档位为 $0.10 USDG,不含请求者的网络 gas 费。其中 $0.08 分配给陪审员/运营方,$0.02 分配给协议。这些是费率分配,并非各模型边际成本的测量值。

tokensK = 1 时的短输入 N3 报价
席位或分配项USDG
Qwen · LARGE_A$0.028
Gemma · DOC_SPECIALIST$0.030
GPT-OSS · DISSENTER$0.022
协议费用$0.020
不含 gas 费的总额$0.100

对于每种类别,合约将基础费用与每档费用乘以 tokensK 的金额相加。接收服务根据提取的文本长度估算档位。协议费用取配置的最低费用和陪审员费用的 20% 中的较大值。更大的输入会提高报价;付款以当前合约报价为准。

成功产生裁决时,治理可以从协议费用中预留一部分,用于未来的人工评审团。按合约默认的 25% 计算,短输入费率中有 $0.005 用于预留,剩余 $0.015 用于质押或支付给配置的核查费用接收方。上线时不启用升级至人工评审团,上线配置也可能将预留比例设为零。状态为 HUNG 时,已响应的陪审员获得报酬,协议费用及超时席位费用会退还。gas 费另计。

MOCHI 由团队发行。其合约地址将会公布;本白皮书不公布代币价格、供应量、销售或回报。客户使用 USDG 付款,无需 MOCHI。一份尚未启用的独立代币经济机制提案描述了在满足运营义务并留足储备后,使用符合条件的服务盈余进行购买和手动销毁。启用是独立事项;核查不会自动购买或销毁代币。

定价依据上线费率配置,结算依据 QueryEscrow。主机托管、失败的推理、结算 gas 费及其他运营成本,并未全部计入评估中的推理成本数字。

10 / 白皮书

隐私

在私密付费流程中,说法和提交的摘录在上传前已于浏览器中加密。明文存在于获准的处理工作负载内部;持久化的私密内容是密封的密文。链上和数据库记录保留哈希、承诺、签名及运行元数据,而非私密说法或回答的明文。

公开链上数据仍会透露钱包活动、付款、查询标识符和时间信息。运营方可以观察流量大小和服务可用性。生产环境遥测仅限不含内容的时间和状态字段,包括查询和模型标识符;它不是私密提示词或结果的日志。

请求者在本地和私密恢复文件中保存结果密钥。丢失密钥可能导致无法访问私密结果;泄露密钥可能暴露结果。独立的受邀研究流程通过外部提供方处理公开说法,并标注为未经远程证明的研究。它的分享和保留方式不应被视为私密协议的保证。

11 / 白皮书

局限与风险

  • 模型可能一起出错。全体一致和逐字引用并不能证明说法属实、来源真实或背景完整。
  • 证据可能不完整或具有对抗性。不会获取提交的 URL 的内容,也不会对其进行独立认证。提示词和片段检查并不能消除所有恶意输入风险。
  • HUNG 的成本与可用性。未达成共识时不会产生回答,但已响应的陪审员仍会获得费用。超时、重试和服务中断可能延迟结果。
  • 对服务提供方的依赖。上线模型家族共用机密推理基础设施,并依赖提供方的可用性和验证服务。
  • 可信执行环境(TEE)的假设。硬件、固件、远程证明辅助材料、密钥管理和经度量的软件可能存在漏洞。治理控制哪些度量值获准。
  • 合约与治理风险。缺陷、配置变更、较短的时间锁和特权暂停权限会影响服务。请求者仍需承担网络 gas 费和交易失败的风险。
  • 客户端与密钥风险。被攻破的浏览器可能在加密前暴露内容。丢失或泄露恢复文件会影响结果访问和隐私。
  • 范围。上线服务提供以证据为依据的说法评估。它不构成财务或法律建议,也不能替代专业核查。

12 / 白皮书

路线图

上线服务仅限 N3 私密说法核查。升级至人工评审团、申诉和更大规模的陪审团均未启用。合约或 SDK 中更广泛的机制仍不属于上线服务范围。

这份路线图围绕核心陪审团执行、可验证记录、常设数据源和构建者接入来安排工作。未来的数据源扩展、智能体接入和升级至人工评审团都取决于验证;上线时不提供人工评审团。路线图不承诺发布日期或生产容量。

随着服务扩展,远程证明拒绝、隐私和所有权控制、超时恢复、HUNG 结算、过期退款及数据源过时后的行为仍是必须通过的验证关卡。代币购买和销毁的启用遵循独立的启用条件,而非路线图中承诺的日期。