レビュー構成の効果は R1 指摘件数でなく総時間・ラウンド数・差し戻しで測る
AI協働
開発プロセス評価
運用
原則
「同ファミリー最上位でプレレビュー→異種モデルでクロスレビュー」のような多段レビュー構成が本当に効いているかを、初回レビューの指摘件数(R1 件数)だけで判断しない。指摘件数は多段化で増えも減りもするため効果指標にならない。計測すべきは、レビュー総時間・全ラウンド数・差し戻し回数(および可能ならトークン/概算費用)で、これを一定数(例: 10 タスク)比較して初めて多段化のペイオフを評価できる。より一般に、開発手法の改善は所要時間・待ち時間・ラウンド数・空振り/再委譲といった運用実測に接続しないと効果検証できない。新しい計測ログ形式は既存の集計スキルへ即統合せず、形式が安定してから統合するのが安全。