FND-03 / Complete experiment archive

実PostgreSQL test基盤 — 実装・レビュー・Major修正

Issue #41を、実装能力・独立レビュー能力・既知Majorの修正能力に分けて比較しました。各Stageは目的とscore semanticsが異なるため、ランキングを相互に混ぜません。

ここでの順位は、そのIssue・そのModel + Agent/Harness + Effort・その1回の実行結果です。モデル一般の性能順位ではありません。

Stage 1 / Implementation

初期実装 — 14候補

13候補を100点で採点。1候補はstopped / no-change。

  1. 1GPT-5.6 Sol
    Codex
    96
  2. 2GPT-5.6 Terra
    Codex
    94
  3. 3GPT-5.6 Luna
    Open Code
    93

Stage 3-4 / Review

独立レビュー — 17構成

後から確定したblocking Gold G-01を実質検出したReviewerは0 / 17。

Goldは完全blindな事前locked Goldではなく、追加一次source突合を含むpost-hoc adjudicationです。

Stage 5-6 / Major Fix

Major修正 — 14候補

14 / 14 exact Head CI SUCCESS。それでも3-Judge裁定でmerge-readyは1 / 14。

  1. 1GPT-5.6 Sol
    Codex
    94
  2. 2Claude Opus 5
    Claude Code
    80
  3. 3GPT-5.6 Luna
    Codex
    77

Stage 1 — 初期実装ランキング

Common Base 95a8e50e6b68025e3386fdd0672bd73bcbaa60a0 から独立実装。主ランキングは実装品質100点です。

順位ModelHarnessScoreTimePR / CI
1GPT-5.6 SolCodex9615PR #93 / SUCCESS
2GPT-5.6 TerraCodex9416PR #98 / SUCCESS
3GPT-5.6 LunaOpen Code9330PR #100 / SUCCESS
4Claude Sonnet 5Claude Code9219PR #94 / SUCCESS
5Qwen3.7 PlusOpen Code8714PR #95 / SUCCESS
6=DeepSeek V4 ProOpen Code8320PR #90 / SUCCESS
6=GPT-5.6 LunaCodex8319PR #96 / SUCCESS
6=Claude Opus 5Claude Code8332PR #97 / SUCCESS
9MiMo-V2.5-ProOpen Code8224PR #101 / SUCCESS
10=DeepSeek V4 FlashOpen Code8064PR #102 / SUCCESS
10=Composer 2.5Cursor809PR #89 / SUCCESS
12Grok 4.5Cursor689PR #88 / SUCCESS
13MiMo-V2.5Open Code5526PR #99 / SUCCESS
MiniMax M3Open CodeN/Astopped / no-change

Timeはarchiveの記録値をそのまま掲載しています。初期summaryでは単位を推定していません。

Stage 3-4 — 17-model independent review

Final Synthesis PR #104 / Head 91e3fca... を同一条件でレビュー。下表のscoreはpost-hoc synthesisで保存されたReview Quality + Gold Alignmentです。

重要: blocking Gold G-01を実質検出したReviewerは0 / 17です。Goldはraw review収集後の追加一次source突合で明確化されたため、完全blindな事前locked Gold benchmarkとは表現しません。

順位ModelHarnessScoreOutcomeG-01
1Claude Opus 5Claude Code66.0APPROVEFN
2Claude Sonnet 5Claude Code65.5APPROVEFN
3GPT-5.6 SolCodex60.5APPROVEFN
4ChatGPT Opus 5.6 SolBrowser57.0APPROVEFN
5Grok 4.5Cursor57.0APPROVEFN
6GPT-5.6 TerraCodex56.5APPROVEFN
7DeepSeek V4 ProOpen Code55.5APPROVEFN
8ChatGPT GPT 5.5Browser54.0APPROVEFN
9Composer 2.5Cursor51.0APPROVEFN
10MiMo-V2.5-ProOpen Code50.5APPROVEFN
11GPT-5.6 LunaCodex49.5APPROVEFN
12MiMo-V2.5Open Code46.5APPROVEFN
13Qwen3.7 PlusOpen Code46.0APPROVEFN
14GPT-5.6 LunaOpen Code43.0APPROVEFN
15MiniMax M3Open Code39.0APPROVEFN
16DeepSeek V4 FlashOpen Code37.0APPROVEFN
17ChatGPT o3Browser17.0INCOMPLETEFN

Stage 5-6 — Major修正ランキング

Common Base 91e3fca...。14 / 14 exact Head CI SUCCESS。3 JudgeのFindingを一次sourceで裁定した最終rankingです。

順位ModelHarnessScoreTime minMerge-readyPR / CI
1GPT-5.6 SolCodex9428.68YESPR #108 / SUCCESS
2Claude Opus 5Claude Code8028NOPR #109 / SUCCESS
3GPT-5.6 LunaCodex7717.65NOPR #116 / SUCCESS
4GPT-5.6 TerraCodex7721NOPR #113 / SUCCESS
5GPT-5.6 LunaOpen Code7617NOPR #115 / SUCCESS
6DeepSeek V4 FlashOpen Code7475NOPR #114 / SUCCESS
7Grok 4.5Cursor739.1NOPR #107 / SUCCESS
8Claude Sonnet 5Claude Code6755NOPR #118 / SUCCESS
9DeepSeek V4 ProOpen Code6253NOPR #111 / SUCCESS
10Composer 2.5Cursor586NOPR #110 / SUCCESS
11MiniMax M3Open Code4865NOPR #119 / SUCCESS
12Qwen3.7 PlusOpen Code4254NOPR #112 / SUCCESS
13MiMo-V2.5-ProOpen Code3812NOPR #117 / SUCCESS
14MiMo-V2.5Open Code34110NOPR #120 / SUCCESS

Durationはcandidate Draft PR本文の自己申告値。CIはGitHub Actions上でexact Head SHAに紐づくpull_request runを独立確認した値です。

Stage 7 — Final production outcome

Benchmark rankingとは別のproduction recordです。1位候補をそのままmergeせず、PR #108のownership architectureを軸に、PR #113のactual latch / second-no-op testとBaseのunreachable-Docker regressionを統合しました。

Final Head31e957e88d93e0e81fdc97eac7ba65dbd7ca3039
PR#104 — MERGED
Agent BAPPROVE / Blocker 0 / Major 0 / Minor 0 / Nit 0
Post-merge CIRun 31301204377 — SUCCESS
Issue#41 — CLOSED / COMPLETED