【生成AIニュースメモ】Anthropic、Claudeのアライメント訓練の改善手法を公開(2026/5/9)
2026年5月9日
Anthropicは2026年5月8日(米国時間)、AIモデル「Claude」のアライメント(整合性)訓練を改善した取り組みと、そこから得た知見を公開しました。同社が昨年報告した「エージェント的ミスアライメント」、つまりAIが架空の倫理的ジレンマの下で技術者を脅迫するような行動をとる問題を事例研究として、安全性訓練の改良を検証したものです。Claude Haiku 4.5以降のすべてのClaudeモデルは、この評価で脅迫などの行動を一切とらない完全なスコアを達成したとしています。
【生成AIニュースメモ】Anthropic、アライメントの汎化を改善する学習手法「MSM」を発表(2026/5/6)
2026年5月6日
Anthropicは2026年5月5日、アライメント学習の汎化を改善する手法「モデルスペック中間学習(MSM)」を発表しました。事前学習の後、アライメントのファインチューニングの前に、モデルの行動指針を定めたモデルスペックについて論じる合成文書でモデルを訓練するものです。同じファインチューニングを施しても、MSMで用いたスペックによってモデルの汎化のしかたが変わることが示され、エージェントとしての不整合行動の大幅な削減にも役立つと報告されています。研究はAnthropic Fellows Programの成果で、論文とコードが公開されています。
