生成AIニュース
【生成AIニュースメモ】Anthropic、Claudeによるアラインメント研究の自動化成果を発表(2026/4/15)

Anthropicは2026年4月14日(米国時間)、Claude自身にアラインメント研究をさせるAnthropic Fellowsの新しい研究成果を発表しました。9体のClaude Opus 4.6に実験環境を与えた「Automated Alignment Researchers(AAR)」が、弱いモデルを教師にして強いモデルを微調整する「weak-to-strong supervision」の改善手法を自律的に考案・検証し、人間の研究者が7日間かけた基準値を大きく上回る成果を5日間で達成。人間より賢いモデルを監督するスケーラブルオーバーサイト研究を実践に近づける結果となりました。

続きを読む