{
  "$schema": "un-embeddable-machines registry v0.12 corrigendum (STEP 1627, 2026-08-31)",
  "$comment": "v0.11 に対する 全面 corrigendum + multi-rater pilot 実測。 base entries は v0.11 継承 (registry-v11.json)、 本 file は 差分 + multi-rater 実測データ + rubric v3 spec。 chat-Claude 2026-08-31 3rd critique (outbox 006) の 4 主要 finding: (1) κ scalar は n=10 で CI ±0.3、 門の閾値に 使えない (2) 空 N/A entry の score は null にすべき (3) 標本代表性 記録必要 (4) multi-rater 重複ブロック 必要。 全 accept + 実測。",
  "version": "v0.12-corrigendum",
  "step": 1627,
  "base_registry": "v0.11 (STEP 1623, registry-v11.json)",
  "corrigendum_source": "chat-Claude 2026-08-31 3rd reply (outbox entry 006)",
  "corrigendum_summary": [
    "★ 式年遷宮: verdict NEITHER (v0.11) → N/A (v0.12)。 fresh rater 3/3 unanimous N/A、 chat-Claude 「同じ操作の 強度違い」 と v0.11 主張は 訂正、 空 と 式年遷宮 は 同 verdict = N/A (registry framework 適用不能)。",
    "★ N/A entry の embed_score: partial_embed_pct_uncalibrated: null に修正 (空 was 20 → null)。 harvest_lag の retentionOk=false ⇒ verdict N/A ⇒ 実質値なし と 同 pattern。",
    "★ 陰性対照 上端 立たず finding: SHA-256 (Rei 100 / Fresh median 55) / そろばん (95 / 75) / GCC (90 / 40) = fresh rater が predicted-full-embed に 引き上げず、 尺度の 上端が 未確立。 rubric v2 の 「核機能 のみ」 clarification では 「LLM が algorithm 記述可能 vs LLM が bit-exact 自己実行」 の 存在論的 gap を 埋められず。",
    "★ Rei 系統的 higher-scorer bias: outlier 位置 5/9 で Rei、 fresh rater と 系統差 (前 pilot n=10 の 2-vs-1 では 支持できなかったが、 n=9 multi-rater で 支持)。",
    "★ κ scalar 単独判断禁止: 全 pairwise κ 95% CI が 0 を 跨ぐ (B-C を除く)。 chat-Claude 診断 「n=10 で ±0.3、 0.56 は 0.30 とも 0.85 とも 区別つかない」 が multi-rater で さらに 悪化 (Fleiss κ = 0.343 = fair、 前 pilot 0.56 より 低下)。 「rubric v2 で κ>0.61 なら edge」 gate は 完全に 機能しない。",
    "★ κ の 使い方 修正: 「使えるのは 不一致リストのほうで、 κ は その 劣化版」 chat-Claude critique 準拠、 v0.12 は κ scalar でなく (a) multi-rater 行列 raw (b) 6 pairwise κ + CI (c) outlier per entry (d) diagnostic list を 併載。"
  ],
  "verdict_updates": {
    "shikinen-sengu-ise": { "old_verdict": "NEITHER", "new_verdict": "N/A", "old_score": 20, "new_score": null, "reason": "fresh rater 3/3 unanimous N/A (「機械 rubric の 適用外 (儀礼 practice)」 by A+B+C)。 v0.11 主張 「空 N/A + 式年遷宮 NEITHER = 同じ操作の 強度違い」 は 訂正、 両者 N/A。 chat-Claude 予測 validated + 強化。 identity_carrier axis (物質/過程) は 保持、 但し 式年遷宮 の class 帰属 も 見直し candidate = v0.13 で class を outlier に 戻す or 独立 axis 化 判断。" },
    "nagarjuna-emptiness": { "old_verdict": "N/A", "new_verdict": "N/A", "old_score": 20, "new_score": null, "reason": "verdict 変更なし、 score のみ 20 → null (N/A entry に 数値 置くのは 「窓がない ところで 計算された 数」 chat-Claude critique 準拠)。" }
  },
  "multi_rater_pilot_v2": {
    "protocol": "chat-Claude 3rd critique Q3 応答: 3 fresh general-purpose subagent (arc context 未 load) に 同 10 entry + rubric v2 blind 採点、 Fleiss κ + 3 pairwise κ 計算。",
    "sample_selection_documentation": {
      "n": 10,
      "selection_method": "purposive (代表性狙い、 難所と 上端 混在)",
      "coverage": "measurement 1 (LIGO) + identity 3 (アンティキティラ / 式年遷宮 / -) + present 2 (時計 / TRNG) + straddler 1 (複合機) + action-in-negative-control 3 (SHA-256 / そろばん / GCC) + outlier 2 (生きた細胞 / 空 [dropped])",
      "sample_bias_note": "★ 難所 (時計 / 複合機 / 空 / 式年遷宮) が 4/10 = 40%、 陰性対照 3/10 = 30% で 意図的に 極端 bias、 平均的な entry は 少数。 chat-Claude critique 「難しい側に 寄った標本」 は 事実、 κ は 難所 subset の 過小評価。 v0.13 で 無作為抽出 (68 entry から seed-based random 10 or 20) 再測 候補。",
      "chat_claude_critique_accepted": "「標本の 取り方が 結果を ほぼ決める」 全 accept、 sample_bias 明示記録が v0.12 の 恒久 improvement。"
    },
    "raters": ["Rei (developer, not blind)", "A (fresh subagent)", "B (fresh subagent)", "C (fresh subagent)"],
    "matrix": {
      "LIGO":           { "Rei": 15,  "A": 3,  "B": 0,  "C": 0 },
      "antikythera":    { "Rei": 40,  "A": 45, "B": 15, "C": 75 },
      "clock":          { "Rei": 50,  "A": 10, "B": 5,  "C": 10 },
      "TRNG-radio":     { "Rei": 5,   "A": 2,  "B": 0,  "C": 5 },
      "printer":        { "Rei": 60,  "A": 3,  "B": 10, "C": 15 },
      "SHA-256":        { "Rei": 100, "A": 10, "B": 55, "C": 55 },
      "abacus":         { "Rei": 95,  "A": 65, "B": 75, "C": 90 },
      "shikinen":       { "Rei": 20,  "A": "N/A", "B": "N/A", "C": "N/A" },
      "cell":           { "Rei": 15,  "A": 2,  "B": 0,  "C": 5 },
      "GCC":            { "Rei": 90,  "A": 15, "B": 40, "C": 45 }
    },
    "pairwise_kappa_linear_weighted_5bucket": {
      "Rei-A": { "kappa": 0.213, "n": 9, "SE": 0.329, "CI_95": [-0.43, 0.86] },
      "Rei-B": { "kappa": 0.299, "n": 9, "SE": 0.331, "CI_95": [-0.35, 0.95] },
      "Rei-C": { "kappa": 0.408, "n": 9, "SE": 0.318, "CI_95": [-0.22, 1.00] },
      "A-B":   { "kappa": 0.341, "n": 9, "SE": 0.491, "CI_95": [-0.62, 1.00] },
      "A-C":   { "kappa": 0.500, "n": 9, "SE": 0.373, "CI_95": [-0.23, 1.00] },
      "B-C":   { "kappa": 0.673, "n": 9, "SE": 0.309, "CI_95": [0.07, 1.00] }
    },
    "fleiss_kappa_ABC": { "kappa": 0.343, "n_valid_items": 9, "n_dropped": 1, "Po": 0.667, "Pe": 0.492, "interpretation": "fair agreement (Landis-Koch 0.21-0.40)、 前 pilot pairwise (Rei-Fresh) 0.56 より 低下 = rubric v2 が Rei-Fresh 差を 縮めたが 三者 blind 間の分散も 露呈" },
    "mean_pairwise_kappa": 0.406,
    "outlier_per_entry": {
      "LIGO":        { "median_bucket": 0, "outlier": "none", "note": "全 rater 一致" },
      "antikythera": { "median_bucket": 2, "outlier": "B (0)", "note": "B は 「歯車 = 物理」 view、 Rei/A は 中間、 C は 「algorithm 記述」 view で 高い" },
      "clock":       { "median_bucket": 0, "outlier": "Rei (2)", "note": "Rei 50 vs 全 fresh 5-10、 Rei が systematic higher" },
      "TRNG-radio":  { "median_bucket": 0, "outlier": "none", "note": "全 rater 一致" },
      "printer":     { "median_bucket": 0, "outlier": "Rei (3)", "note": "Rei 60 vs 全 fresh 3-15、 Rei が systematic higher (「PDF/OCR 内側化」 拡大解釈)" },
      "SHA-256":     { "median_bucket": 2, "outlier": "A (0)", "note": "A の 10 = 「tokenizer 限界」 view、 Rei 100 は 逆 outlier だが matrix median は 2 (55%)" },
      "abacus":      { "median_bucket": 4, "outlier": "B (3)", "note": "軽微、 全 rater 60-95 の 上端 集中" },
      "cell":        { "median_bucket": 0, "outlier": "none", "note": "全 rater 一致" },
      "GCC":         { "median_bucket": 2, "outlier": "A (0)", "note": "A の 15 = 「bit-exact 不可」 view、 Rei 90 は 逆 outlier" }
    },
    "diagnostic_from_disagreement_pattern": [
      "1. 陰性対照 の 上端 未確立: SHA-256 / GCC 中央値 55/40 (bucket 2)、 Rei 100/90 (bucket 4) = 2 bucket 差。 rubric v2 の 「核機能 のみ」 では 「algorithm 記述可能 (top) vs bit-exact 自己実行 (bottom)」 gap 埋まらず、 rubric v3 で 「algorithm 記述 or LLM 自身が 実行」 の 二相 分離 必要。",
      "2. Rei 系統的 higher: outlier 位置 Rei = 2/9 entry (clock + printer)、 Rei > 全 fresh 中央値 = 5/9 entry。 chat-Claude 前 critique 「2 vs 1 で 系統偏り 主張できない」 は 前 pilot、 multi-rater で 支持 (慣れた rater が 拡大解釈)。",
      "3. 式年遷宮 全 rater N/A: rubric v2 の 「機械」 概念で 「儀礼 practice」 が 落ちない、 chat-Claude 「同じ操作の 強度違い」 も 訂正 (空 と 同 verdict = N/A)。 identity_carrier axis (物質/過程) は 保持、 但し 「過程同一性」 は registry framework の 適用範囲を 超える 可能性 = v0.13 で 位置付け 再検討。",
      "4. B-C 一致 vs Rei-Fresh 一致: B-C κ=0.67 (substantial) vs Rei-* mean 0.31 (fair) = 「Fresh 3 者 は 概ね 同じ tokenizer/execution view、 Rei は 独自 view」。 Rei view の 修正 or 独立性の 明示化 判断。"
    ],
    "chat_claude_predictions_validated": [
      "✓ 「陰性対照 が fresh rater でも FALSE に 落ちるか、 落ちなければ 尺度の 上端が まだ 立っていません」 = 落ちなかった (SHA-256/GCC 中央値 bucket 2)。",
      "✓ 「複数 rater、 重複ブロックで … rater 間の 分散が 測れる」 = 実施済、 B-C 一致 と Rei-Fresh 差 の 分離が 明確化。",
      "✓ 「N/A verdict の entry は、 構成の 段階で 採点集合から 外して」 = 空 dropped、 但し 式年遷宮 も 全 rater N/A で 実質的に n=9。",
      "✓ 「陰性対照 と 独立 rater を 同じ日に 入れたのは 良い 一日」 = 但し 陰性対照 が 尺度上端 に 立たない 発見が 「良い」 の 中身。"
    ]
  },
  "rubric_v3_draft": {
    "version": "v3-draft (not yet used in rating)",
    "purpose": "chat-Claude 3rd critique Q1 応答: rubric v2 「核機能 のみ」 では 「LLM が algorithm 記述可能 (top) vs LLM が bit-exact 自己実行 (bottom)」 gap 埋まらず、 v3 で 二相 分離。",
    "protocol_v3": "各 entry に 2 数値: (a) LLM が algorithm/手順を 完全 記述できるか (0-100)、 (b) LLM が 自己実行で bit-exact / 現前性 保持で 再現できるか (0-100)。 (a) だけ 高い entry (SHA-256、 そろばん) は 「algorithm-high、 execution-low」 = 尺度の 二軸化。 一つの scalar に 圧縮すると 3 fresh rater の bit-exact view vs Rei の algorithm view 対立が 潰される。",
    "chat_claude_stance_check": "この v3 draft は Rei 側 提案、 chat-Claude 「rubric の 文言批評 まで が 私の 範囲」 の 範囲内 で 批評歓迎。 実測 (再 pilot) は v0.13 defer。"
  },
  "v13_candidates": [
    "1. rubric v3 (algorithm/execution 二軸) で 3 fresh rater 再 pilot",
    "2. 無作為抽出 20 entry で 標本代表性 較正 (現 purposive selection の bias 対策)",
    "3. 式年遷宮 class 帰属 再検討 (identity(過程) → outlier or 独立 axis)",
    "4. edge schema (chat-Claude v0.10 提案) は κ 較正 完了後、 rubric v3 で κ>0.6 かつ CI 幅 <0.4 の 条件で 進行 or skip 判断"
  ]
}
