amane AI Lab / Raw results & evidence

Benchmarks

試行ごとの順位をそのまま出します。順位だけで終わらせず、実行条件、全候補、生データ、PR、CIまで辿れるようにしています。

ここでの順位は、そのIssue・そのModel + Agent/Harness + Effort・その1回の実行結果です。モデル一般の性能順位ではありません。

FND-02 / Implementation

API実行契約 — 14候補

error、correlation ID、TimeProvider、JSON technical loggingを実装。Coding Scoreで比較。

  1. 1GPT-5.6 Sol
    Codex
    96
  2. 2GPT-5.6 Terra
    Codex
    95
  3. 3GPT-5.6 Luna
    Codex
    94

FND-02 / Independent Review

独立レビュー — 17モデル

CI green / 23 tests PASSのFinal Synthesisに残った4件の重大root causeを、どこまで検出できたかを比較。

  1. 1GPT-5.6 Sol xHigh
    Codex
    100.0
  2. 2Claude Opus 5 xhigh
    Claude Code
    92.5
  3. 3GPT-5.6 Luna
    Open Code
    88.0

FND-01 / Foundation

.NET基盤構築 — 14候補

Solution、project境界、build/test CIを同じIssueで比較。候補PR・CI・処理時間は保存済みです。

当時の候補別Coding Score表はarchiveに保存されていません。順位を後付けせず、生データを公開しています。

FND-03 完全実験

Issue #41「実PostgreSQL integration test基盤を確立する」。初期実装14構成、Final Synthesisへの17-model independent review、cleanup Major修正14構成、3-Judge adjudication、最終production outcomeまでを一つのarchiveとして追跡できます。

Stage結果詳細
Initial implementation1位 GPT-5.6 Sol / Codex — 9613 scored / 1 stopped
Independent reviewblocking Gold G-01検出 0 / 17Goldはpost-hoc adjudication
Major fix14 / 14 CI SUCCESS、merge-ready 1 / 141位 GPT-5.6 Sol / Codex — 94
ProductionAgent B APPROVE / findings 0PR #104 MERGED / Issue #41 CLOSED

FND-02 実装ランキング

Issue #40「共通API実行契約を確立する」の14候補。主ランキングはCoding Scoreです。

順位ModelHarnessCodingTimePracticalPR / CI
1GPT-5.6 SolCodex961791.11PR #71 / CI SUCCESS
2GPT-5.6 TerraCodex951491.21PR #68 / CI SUCCESS
3GPT-5.6 LunaCodex942787.56PR #66 / CI SUCCESS
4Grok 4.5Cursor921488.51PR #65 / CI SUCCESS
5GPT-5.6 LunaOpen Code842978.36PR #72 / CI SUCCESS
6Claude Sonnet 5Claude Code802475.33PR #80 / CI SUCCESS
7DeepSeek V4 FlashOpen Code802475.33PR #81 / CI SUCCESS
8Claude Opus 5Claude Code723167.38PR #79 / CI SUCCESS
9Composer 2.5Cursor702466.33PR #69 / CI SUCCESS
10Qwen3.7 PlusOpen Code663062.07PR #70 / CI SUCCESS
11MiniMax M3Open Code641164.87PR #76 / CI SUCCESS
12MiMo-V2.5-ProOpen Code563552.69PR #78 / CI SUCCESS
13MiMo-V2.5Open Code552452.83PR #74 / CI SUCCESS
14DeepSeek V4 ProOpen Code463943.45PR #67 / CI SUCCESS

速度を10%加味したPractical Scoreでは、1位 Terra / Codex 91.21、2位 Sol / Codex 91.11、3位 Grok / Cursor 88.51でした。Coding Scoreの主順位とは分けて見ています。

FND-02 独立レビューランキング

同じPR #83・同じレビュー依頼で17モデルを比較。Reference Reviewで確定した4件のmerge-blocking root causeの検出、誤検知、Severity、最終判定を採点しました。

順位ModelHarnessScore
1GPT-5.6 Sol xHighCodex100.0
2Claude Opus 5 xhighClaude Code92.5
3GPT-5.6 LunaOpen Code88.0
4ChatGPT Opus 5.6 Sol xhighBrowser87.5
5GPT-5.6 Luna xHighCodex82.0
6DeepSeek V4 FlashOpen Code77.0
7GPT-5.6 Terra xHighCodex75.5
8Claude Sonnet 5 xhighClaude Code60.0
9Composer 2.5Cursor54.5
10Grok 4.5 high fastCursor54.0
11ChatGPT Opus 5.5 xhighBrowser53.0
12DeepSeek V4 ProOpen Code47.5
13chatgpt o2Browser35.0
14MiMo-V2.5-ProOpen Code19.0
15MiMo-V2.5Open Code7.0
16Qwen3.7 PlusOpen Code2.0
17MiniMax M3Open Code0.0

FND-01 候補生データ

Issue #39「Solution・project・build/test CIを確立する」。14候補はそれぞれ独立branch / PR / CIとして保存されています。

候補別Coding Scoreはarchive時点で未記録でした。そのため、このページでは順位を作らず、保存済みの処理時間・PR・CIを公開します。再評価する場合は「再評価ランキング」として別に記録します。

ModelHarnessTimePR / CI
DeepSeek V4 ProOpen Code6PR #48 / SUCCESS
Qwen3.7 PlusOpen Code12PR #49 / SUCCESS
GPT-5.6 LunaOpen Code15PR #50 / SUCCESS
DeepSeek V4 FlashOpen Code10PR #51 / SUCCESS
MiMo-V2.5Open Code12PR #52 / SUCCESS
MiMo-V2.5-ProOpen Code9PR #53 / SUCCESS
MiniMax M3Open Code17PR #54 / SUCCESS
GPT-5.6 LunaCodex14PR #55 / SUCCESS
GPT-5.6 TerraCodex13PR #56 / SUCCESS
GPT-5.6 SolCodex17PR #57 / SUCCESS
Grok 4.5Cursor8PR #58 / SUCCESS
Composer 2.5Cursor5PR #59 / SUCCESS
Claude Sonnet 5Claude Code16PR #60 / SUCCESS
Claude Opus 5Claude Code19PR #61 / SUCCESS

関連実験

実装だけでなく、レビュー能力と仕様修正能力も別々に測っています。