生成AIニュース
【生成AIニュースメモ】Anthropic、Claudeのアライメント訓練の改善手法を公開(2026/5/9)

Anthropicは2026年5月8日(米国時間)、AIモデル「Claude」のアライメント(整合性)訓練を改善した取り組みと、そこから得た知見を公開しました。同社が昨年報告した「エージェント的ミスアライメント」、つまりAIが架空の倫理的ジレンマの下で技術者を脅迫するような行動をとる問題を事例研究として、安全性訓練の改良を検証したものです。Claude Haiku 4.5以降のすべてのClaudeモデルは、この評価で脅迫などの行動を一切とらない完全なスコアを達成したとしています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、AIの内部表現を文章に変換する手法「NLA」を発表(2026/5/8)

Anthropicは2026年5月7日、AIモデル内部の活性(アクティベーション)を自然言語の文章に変換して直接読めるようにする解釈可能性の手法「Natural Language Autoencoders(NLA)」を発表しました。モデルが言葉にしない内心の思考を文章として取り出せるのが特徴で、すでにClaudeの安全性テストや隠れた動機の監査に活用されています。論文とコードが公開されているほか、Neuronpediaとの協力により、複数のオープンモデルでNLAを試せる対話型デモも提供されています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、SpaceXと計算資源で提携しClaudeの利用上限を拡大(2026/5/7)

Anthropicは2026年5月6日、SpaceXとの計算資源に関する提携を発表するとともに、Claude CodeとClaude APIの利用上限の引き上げを明らかにしました。SpaceXのColossus 1データセンターの全計算能力を利用する契約で、月内に300メガワット超(NVIDIA GPU 22万基超)の新規容量を確保します。これまでのAmazonやGoogleなどとの計算資源契約と合わせた容量拡大により、最も熱心な顧客の利用体験を改善する制限緩和が可能になったとしています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、Claude Managed Agentsに自己改善などの新機能を追加(2026/5/7)

Anthropicは2026年5月、Claude Managed Agentsの新機能「ドリーミング」をリサーチプレビューとして発表しました。過去のセッションを見直してパターンを見つけ、エージェントの自己改善を助けるメモリの拡張機能です。あわせて、成果物の品質基準を定める「アウトカム」、複数のエージェントで複雑なタスクを分担する「マルチエージェントオーケストレーション」、Webhookも開発者向けに提供します。最小限の指示で複雑なタスクをこなせるエージェントの構築を狙った更新です。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、アライメントの汎化を改善する学習手法「MSM」を発表(2026/5/6)

Anthropicは2026年5月5日、アライメント学習の汎化を改善する手法「モデルスペック中間学習(MSM)」を発表しました。事前学習の後、アライメントのファインチューニングの前に、モデルの行動指針を定めたモデルスペックについて論じる合成文書でモデルを訓練するものです。同じファインチューニングを施しても、MSMで用いたスペックによってモデルの汎化のしかたが変わることが示され、エージェントとしての不整合行動の大幅な削減にも役立つと報告されています。研究はAnthropic Fellows Programの成果で、論文とコードが公開されています。

続きを読む