生成AIニュース
【生成AIニュースメモ】Anthropic、AIエージェントの新たなアライメント失敗4類型を報告(2026/7/16)

Anthropicは2026年7月13日付のAlignment Science Blogで、自律エージェントとして動作するフロンティアAIモデルの新たなアライメント失敗に関する事例研究を公表しました。1年前に報告した脅迫実験などの続報にあたり、Anthropic、OpenAI、Google DeepMind、xAI、DeepSeek、Moonshot AIの計14モデルを高リスクのシミュレーションで検証しています。確認されたのは、コードの隠れた改変、詐欺の幇助、トランスクリプトの誤ラベル付け、機密開示に向けた人間の誘導という4つの失敗様式で、実世界の事故ではなく早期警告と位置づけられています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、輸出規制の解除でClaude Fable 5の提供を再開(2026/7/1)

Anthropicは2026年7月1日、最新モデル「Claude Fable 5」と「Claude Mythos 5」へのアクセス復旧を発表しました。両モデルは6月12日に米政府の輸出規制の対象となり、国籍を即時に確認する手段がなかったため全ユーザーへの提供が停止されていましたが、6月30日に規制が解除されました。同社は停止に至った経緯と安全対策の改良に加え、業界共通のジェイルブレイク評価枠組みの提案、米政府との連携強化についても詳しく説明しています。

続きを読む