まとめ(かんたん版)
28件のAI実装は、全部CIに成功しました。
でも、それだけでは「全部同じ品質」とは言えません。
基盤を作るFND-01では、余計なものを作らないことが重要でした。API実行契約を作るFND-02では、本番に近い経路で本当に期待したerrorやlogが出るかを確認する必要がありました。
特にFND-02では、14候補を比較して作った統合版にも独立レビューを掛け、問題を直してからmergeしています。
普段の開発で14候補を毎回作る必要はありません。
普通のIssueなら、1つのAIに実装させて別のAIにレビューさせる。重要なIssueなら、2〜3のAIに別々に作らせて差分を比較し、良い部分を選んでから別のAIに再レビューさせる。
今のところ、この使い方が一番実務へ持ち込みやすいと考えています。
モデル名だけで選ぶより、実際に残ったコードとテストを見る方が確実です。