{
  "schemaVersion": 1,
  "generatedFrom": "content/articles",
  "articles": [
    {
      "id": "KB-2026-0006",
      "slug": "fnd03-failure-path-benchmark",
      "title": "17のAIレビューが見逃した。14の修正は全部CI成功、それでもmergeできたのは1つだった",
      "description": "実PostgreSQLテスト基盤を14構成で実装し、統合版を17構成で独立レビューした。17件のraw reviewはいずれもblocking Majorを検出できず、その後の修正14件はCIが全成功。それでも最終裁定でmerge-readyだったのは1件だけだった。",
      "status": "published",
      "publishedAt": "2026-08-09",
      "updatedAt": "2026-08-09",
      "lastVerifiedAt": "2026-08-09",
      "tags": [
        "AIコーディング",
        "AIレビュー",
        "AIエージェント",
        "ベンチマーク",
        "Testcontainers",
        "PostgreSQL",
        "品質保証"
      ],
      "agents": [
        "FND-03 完全実験アーカイブ"
      ],
      "url": "/articles/2026/kb-2026-0006-fnd03-failure-path-benchmark/",
      "year": "2026"
    },
    {
      "id": "KB-2026-0005",
      "slug": "28-ai-implementations",
      "title": "28回AIに実装させ、28回CIが通った。それでも「良い実装」は同じではなかった",
      "description": "14のAIコーディング構成を、性質の違う2つのIssueで比較した。候補28件のCIはすべて成功。それでも、実コード、Scope、テストの質、本番に近い検証まで見ると差は残った。",
      "status": "published",
      "publishedAt": "2026-08-08",
      "updatedAt": "2026-08-08",
      "lastVerifiedAt": "2026-08-08",
      "tags": [
        "AIコーディング",
        "AIエージェント",
        "実装比較",
        "ベンチマーク",
        "マルチエージェント",
        "品質保証"
      ],
      "agents": [
        "FND-01 実装比較ベンチマーク",
        "FND-02 実装比較ベンチマーク"
      ],
      "url": "/articles/2026/kb-2026-0005-28-ai-implementations/",
      "year": "2026"
    },
    {
      "id": "KB-2026-0004",
      "slug": "spec-fix-benchmark",
      "title": "レビュー指摘を正しく直せるAIはどれか――14モデルの仕様修正ベンチマーク",
      "description": "レビューで問題を見つける能力と、指摘を安全に修正する能力は別である。14モデルへ同じ仕様修正を依頼したところ、参考点が高くても未承認の製品判断を確定して公式には無効となる提出が多く、重大失格なしの有効提出は2件だけだった。",
      "status": "published",
      "publishedAt": "2026-08-02",
      "updatedAt": "2026-08-02",
      "lastVerifiedAt": "2026-08-02",
      "tags": [
        "LLM",
        "AIエージェント",
        "仕様修正",
        "ベンチマーク",
        "独立レビュー",
        "品質保証"
      ],
      "agents": [
        "spec-fix-001 仕様修正ベンチマーク"
      ],
      "url": "/articles/2026/kb-2026-0004-spec-fix-benchmark/",
      "year": "2026"
    },
    {
      "id": "KB-2026-0003",
      "slug": "llm-review-benchmark",
      "title": "16件のLLM独立レビューで分かったこと――仕様レビュー精度とマルチモデル審理の実務",
      "description": "同一の製品仕様と正本資料を16件のLLMへ渡し、Round 1で確定したGold Findingに照らして再評価した。上位モデルでも重大な見逃しは残り、16件中、根拠と重大度を含めて正しくFAILへ到達したのは8件だった。単発レビューや多数決ではなく、異種モデルの独立レビューと根本原因単位の審理を組み合わせる必要がある。",
      "status": "published",
      "publishedAt": "2026-08-02",
      "updatedAt": "2026-08-02",
      "lastVerifiedAt": "2026-08-02",
      "tags": [
        "LLM",
        "AIレビュー",
        "仕様レビュー",
        "ベンチマーク",
        "マルチエージェント",
        "品質保証"
      ],
      "agents": [
        "16-model benchmark"
      ],
      "url": "/articles/2026/kb-2026-0003-llm-review-benchmark/",
      "year": "2026"
    },
    {
      "id": "KB-2026-0002",
      "slug": "china-ai-api-evaluation",
      "title": "中国製AIモデルAPIを日本から導入する前に確認すべきこと――3つのAI調査の比較と検証計画",
      "description": "第1層は3つのAI調査による評価方法と中国製系列候補（DeepSeek／Qwen／GLM／Kimi／MiniMax）の整理で、単一勝者は決めない。第2層の2026-08-01個人開発向け追記は、DeepSeek／GLM／Kimiの一次情報で価格・接続を具体化する。第3層のコーディング再比較は公表ベンチとAPI費用でCoding Agent向け段階ルーティングを見直し、Flash-0731やGLM-5.2に加えGPT-5.6 Luna／Terra／SolとClaude Opus 5も含む。法人導入は第1層の検証計画を優先する。",
      "status": "published",
      "publishedAt": "2026-07-31",
      "updatedAt": "2026-08-01",
      "lastVerifiedAt": "2026-08-01",
      "tags": [
        "中国製AIモデル",
        "API",
        "コーディング",
        "AIエージェント",
        "モデル評価",
        "セキュリティ"
      ],
      "agents": [
        "ChatGPT",
        "Gemini Pro",
        "Gemini 思考"
      ],
      "url": "/articles/2026/kb-2026-0002-china-ai-api-evaluation/",
      "year": "2026"
    },
    {
      "id": "KB-2026-0001",
      "slug": "ai-agent-collaborative-dev-future",
      "title": "AIエージェント協働型開発の未来",
      "description": "AI開発で希少になるのは、コードや単なる証拠ログではない。重要な不確実性を減らす独立した証拠設計と、残余リスクを引き受ける能力である。",
      "status": "published",
      "publishedAt": "2026-07-31",
      "updatedAt": "2026-07-31",
      "lastVerifiedAt": "2026-07-31",
      "tags": [
        "AIエージェント",
        "SDLC",
        "人材戦略",
        "未来予測",
        "検証"
      ],
      "agents": [
        "ChatGPT",
        "Claude"
      ],
      "url": "/articles/2026/kb-2026-0001-ai-agent-collaborative-dev-future/",
      "year": "2026"
    }
  ]
}
