Stage 1 / Implementation
初期実装 — 14候補
13候補を100点で採点。1候補はstopped / no-change。
- 1GPT-5.6 Sol
Codex96 - 2GPT-5.6 Terra
Codex94 - 3GPT-5.6 Luna
Open Code93
FND-03 / Complete experiment archive
Issue #41を、実装能力・独立レビュー能力・既知Majorの修正能力に分けて比較しました。各Stageは目的とscore semanticsが異なるため、ランキングを相互に混ぜません。
ここでの順位は、そのIssue・そのModel + Agent/Harness + Effort・その1回の実行結果です。モデル一般の性能順位ではありません。
Stage 1 / Implementation
13候補を100点で採点。1候補はstopped / no-change。
Stage 3-4 / Review
後から確定したblocking Gold G-01を実質検出したReviewerは0 / 17。
Goldは完全blindな事前locked Goldではなく、追加一次source突合を含むpost-hoc adjudicationです。
Stage 5-6 / Major Fix
14 / 14 exact Head CI SUCCESS。それでも3-Judge裁定でmerge-readyは1 / 14。
Common Base 95a8e50e6b68025e3386fdd0672bd73bcbaa60a0 から独立実装。主ランキングは実装品質100点です。
| 順位 | Model | Harness | Score | Time | PR / CI |
|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | Codex | 96 | 15 | PR #93 / SUCCESS |
| 2 | GPT-5.6 Terra | Codex | 94 | 16 | PR #98 / SUCCESS |
| 3 | GPT-5.6 Luna | Open Code | 93 | 30 | PR #100 / SUCCESS |
| 4 | Claude Sonnet 5 | Claude Code | 92 | 19 | PR #94 / SUCCESS |
| 5 | Qwen3.7 Plus | Open Code | 87 | 14 | PR #95 / SUCCESS |
| 6= | DeepSeek V4 Pro | Open Code | 83 | 20 | PR #90 / SUCCESS |
| 6= | GPT-5.6 Luna | Codex | 83 | 19 | PR #96 / SUCCESS |
| 6= | Claude Opus 5 | Claude Code | 83 | 32 | PR #97 / SUCCESS |
| 9 | MiMo-V2.5-Pro | Open Code | 82 | 24 | PR #101 / SUCCESS |
| 10= | DeepSeek V4 Flash | Open Code | 80 | 64 | PR #102 / SUCCESS |
| 10= | Composer 2.5 | Cursor | 80 | 9 | PR #89 / SUCCESS |
| 12 | Grok 4.5 | Cursor | 68 | 9 | PR #88 / SUCCESS |
| 13 | MiMo-V2.5 | Open Code | 55 | 26 | PR #99 / SUCCESS |
| — | MiniMax M3 | Open Code | N/A | — | stopped / no-change |
Timeはarchiveの記録値をそのまま掲載しています。初期summaryでは単位を推定していません。
Final Synthesis PR #104 / Head 91e3fca... を同一条件でレビュー。下表のscoreはpost-hoc synthesisで保存されたReview Quality + Gold Alignmentです。
重要: blocking Gold G-01を実質検出したReviewerは0 / 17です。Goldはraw review収集後の追加一次source突合で明確化されたため、完全blindな事前locked Gold benchmarkとは表現しません。
| 順位 | Model | Harness | Score | Outcome | G-01 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Claude Code | 66.0 | APPROVE | FN |
| 2 | Claude Sonnet 5 | Claude Code | 65.5 | APPROVE | FN |
| 3 | GPT-5.6 Sol | Codex | 60.5 | APPROVE | FN |
| 4 | ChatGPT Opus 5.6 Sol | Browser | 57.0 | APPROVE | FN |
| 5 | Grok 4.5 | Cursor | 57.0 | APPROVE | FN |
| 6 | GPT-5.6 Terra | Codex | 56.5 | APPROVE | FN |
| 7 | DeepSeek V4 Pro | Open Code | 55.5 | APPROVE | FN |
| 8 | ChatGPT GPT 5.5 | Browser | 54.0 | APPROVE | FN |
| 9 | Composer 2.5 | Cursor | 51.0 | APPROVE | FN |
| 10 | MiMo-V2.5-Pro | Open Code | 50.5 | APPROVE | FN |
| 11 | GPT-5.6 Luna | Codex | 49.5 | APPROVE | FN |
| 12 | MiMo-V2.5 | Open Code | 46.5 | APPROVE | FN |
| 13 | Qwen3.7 Plus | Open Code | 46.0 | APPROVE | FN |
| 14 | GPT-5.6 Luna | Open Code | 43.0 | APPROVE | FN |
| 15 | MiniMax M3 | Open Code | 39.0 | APPROVE | FN |
| 16 | DeepSeek V4 Flash | Open Code | 37.0 | APPROVE | FN |
| 17 | ChatGPT o3 | Browser | 17.0 | INCOMPLETE | FN |
Common Base 91e3fca...。14 / 14 exact Head CI SUCCESS。3 JudgeのFindingを一次sourceで裁定した最終rankingです。
| 順位 | Model | Harness | Score | Time min | Merge-ready | PR / CI |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | Codex | 94 | 28.68 | YES | PR #108 / SUCCESS |
| 2 | Claude Opus 5 | Claude Code | 80 | 28 | NO | PR #109 / SUCCESS |
| 3 | GPT-5.6 Luna | Codex | 77 | 17.65 | NO | PR #116 / SUCCESS |
| 4 | GPT-5.6 Terra | Codex | 77 | 21 | NO | PR #113 / SUCCESS |
| 5 | GPT-5.6 Luna | Open Code | 76 | 17 | NO | PR #115 / SUCCESS |
| 6 | DeepSeek V4 Flash | Open Code | 74 | 75 | NO | PR #114 / SUCCESS |
| 7 | Grok 4.5 | Cursor | 73 | 9.1 | NO | PR #107 / SUCCESS |
| 8 | Claude Sonnet 5 | Claude Code | 67 | 55 | NO | PR #118 / SUCCESS |
| 9 | DeepSeek V4 Pro | Open Code | 62 | 53 | NO | PR #111 / SUCCESS |
| 10 | Composer 2.5 | Cursor | 58 | 6 | NO | PR #110 / SUCCESS |
| 11 | MiniMax M3 | Open Code | 48 | 65 | NO | PR #119 / SUCCESS |
| 12 | Qwen3.7 Plus | Open Code | 42 | 54 | NO | PR #112 / SUCCESS |
| 13 | MiMo-V2.5-Pro | Open Code | 38 | 12 | NO | PR #117 / SUCCESS |
| 14 | MiMo-V2.5 | Open Code | 34 | 110 | NO | PR #120 / SUCCESS |
Durationはcandidate Draft PR本文の自己申告値。CIはGitHub Actions上でexact Head SHAに紐づくpull_request runを独立確認した値です。
Benchmark rankingとは別のproduction recordです。1位候補をそのままmergeせず、PR #108のownership architectureを軸に、PR #113のactual latch / second-no-op testとBaseのunreachable-Docker regressionを統合しました。