生成AIニュース
【生成AIニュースメモ】Anthropic、Claudeによるアラインメント研究の自動化成果を発表(2026/4/15)

Anthropicは2026年4月14日(米国時間)、Claude自身にアラインメント研究をさせるAnthropic Fellowsの新しい研究成果を発表しました。9体のClaude Opus 4.6に実験環境を与えた「Automated Alignment Researchers(AAR)」が、弱いモデルを教師にして強いモデルを微調整する「weak-to-strong supervision」の改善手法を自律的に考案・検証し、人間の研究者が7日間かけた基準値を大きく上回る成果を5日間で達成。人間より賢いモデルを監督するスケーラブルオーバーサイト研究を実践に近づける結果となりました。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、推論が長いほどAIの誤りは非一貫になるとの研究を公開(2026/2/3)

AnthropicのAlignment Scienceブログで2026年2月、AIシステムの失敗の性質を分析した研究「The Hot Mess of AI」が公開されました。2025年夏の第1期Anthropic Fellowsプログラムの一環として行われたもので、AIが失敗するとき、意図しない目標を体系的に追求する形で失敗するのか、それともどの目標も推進しない支離滅裂な行動で失敗するのかを問い、フロンティア推論モデルの誤りを系統的なバイアスと非一貫なバリアンスに分解して定量的に検証しています。タスクが難しく推論が長くなるほど、失敗は系統的なミスアラインメントよりも非一貫性に支配されるようになると報告しています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、LLMの人格を安定させる「アシスタント軸」を特定(2026/1/20)

Anthropicは2026年1月19日(米国時間)、大規模言語モデルの「アシスタント」人格が内部でどのように表現されているかを調べた解釈可能性研究を発表しました。MATSとAnthropic Fellowsプログラムを通じて実施されたもので、Gemma 2 27B、Qwen 3 32B、Llama 3.3 70Bの3つのオープンウェイトモデルを対象に、275種類のキャラクター類型に対応する神経活動を抽出して「人格空間」を写像し、その主要な変動方向である「アシスタント軸」がアシスタントらしさを捉えることを見いだしました。軸上の活性を監視・制限することで、有害な出力につながる人格の逸脱を検知・抑制できるとしています。

続きを読む