生成AIニュース
【生成AIニュースメモ】Anthropic、エージェント評価はインフラ設定で最大6ポイント変動と報告(2026/2/6)

Anthropicは2026年2月5日(米国時間)、SWE-benchやTerminal-Benchのようなエージェント型コーディングベンチマークのスコアが、実行インフラの構成だけで数ポイント変動しうることを定量化した技術記事を公開しました。社内実験では、Terminal-Bench 2.0でリソースを最も厳しく制限した構成と最も潤沢な構成の差が6ポイント(p<0.01)に達し、リーダーボード上位モデル間の差を超える規模でした。ベンチマークスコアがモデル選定の判断材料になる中、リソース構成を実験変数として文書化・統制すべきだと提言しています。

続きを読む