学習モデルの健康診断は再学習と出荷判定を分離し、固定評価で現行→候補best/lastの順に測る
機械学習
品質評価
運用設計
判断
運用
学習モデルの「健康診断」と改善・出荷は別の行為として扱う。診断で再学習を行う場合も、まず出荷中のアーティファクトを製品と同じ閾値・固定評価セットで測り、次に比較条件を揃えた再学習候補の best と last を同じセットで測る。評価セットは診断中に再生成しない。これにより、既存モデルの現在地、再学習による差、学習途中の選択差を同じ物差しで比較できる。
製品経路の健全性は、出荷中モデルの実ブラウザ/実ランタイム経路と評価ハーネスの等価性テストで確認する。候補モデルを製品へ差し替えて確認するのは出荷工程であり、健康診断では行わない。診断のための一時成果物は配布先へコピーせず、外部同期やコミットもしない。
判定では合格本数だけでなく、検出率・誤検出率など主要値を現行と並べる。候補が全ゲートを通っても、差が測定ばらつきの範囲内なら改善とは扱わない。逆に明確な改善が見えても、健康診断の依頼だけなら出荷判断と変更作業を分離して報告する。
検証時には、起点重み、epoch 数、seed、素材、製品閾値を記録する。どれかが異なる run は世代比較に使わない。固定評価、製品経路、比較条件、外部副作用の禁止を一組にすることで、診断が意図せずモデル更新へ変質するのを防げる。