生成AIニュース
【生成AIニュースメモ】Anthropic、AIエージェントの新たなアライメント失敗4類型を報告(2026/7/16)

Anthropicは2026年7月13日付のAlignment Science Blogで、自律エージェントとして動作するフロンティアAIモデルの新たなアライメント失敗に関する事例研究を公表しました。1年前に報告した脅迫実験などの続報にあたり、Anthropic、OpenAI、Google DeepMind、xAI、DeepSeek、Moonshot AIの計14モデルを高リスクのシミュレーションで検証しています。確認されたのは、コードの隠れた改変、詐欺の幇助、トランスクリプトの誤ラベル付け、機密開示に向けた人間の誘導という4つの失敗様式で、実世界の事故ではなく早期警告と位置づけられています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、輸出規制の解除でClaude Fable 5の提供を再開(2026/7/1)

Anthropicは2026年7月1日、最新モデル「Claude Fable 5」と「Claude Mythos 5」へのアクセス復旧を発表しました。両モデルは6月12日に米政府の輸出規制の対象となり、国籍を即時に確認する手段がなかったため全ユーザーへの提供が停止されていましたが、6月30日に規制が解除されました。同社は停止に至った経緯と安全対策の改良に加え、業界共通のジェイルブレイク評価枠組みの提案、米政府との連携強化についても詳しく説明しています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、Mythosクラスの「Claude Fable 5」と「Mythos 5」を公開(2026/6/10)

Anthropicは2026年6月9日(米国時間)、Opusクラスの上に位置づけた「Mythosクラス」の新モデル、Claude Fable 5とClaude Mythos 5を同時に公開しました。Fable 5は安全策を組み込んだうえで一般向けに提供され、Mythos 5は同じ基盤モデルから一部領域の安全策を外したもので、Project Glasswingの参加者など限られた相手にだけ提供されます。Fable 5は同社がこれまで一般提供したどのモデルよりも高い能力を持ち、長く複雑なタスクほど従来モデルとの差が開くとしています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、AIによるAI開発の加速を示すデータと自己改善の見通しを公表(2026/6/5)

Anthropicの研究組織The Anthropic Instituteは2026年6月5日、AIシステムがAI開発そのものを加速させている現状と、AIが自らの後継を完全自律で設計・開発する「再帰的自己改善」への見通しをまとめた記事を公開しました。公開ベンチマークと同社内部の未公表データを用いた分析で、再帰的自己改善はまだ実現しておらず不可避でもないものの、多くの組織が備えるより早く到来し得ると論じています。実現すれば科学や医療などに大きな利益をもたらす一方、人間がAIの制御を失うリスクを高める可能性も指摘しています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、Claudeのアライメント訓練の改善手法を公開(2026/5/9)

Anthropicは2026年5月8日(米国時間)、AIモデル「Claude」のアライメント(整合性)訓練を改善した取り組みと、そこから得た知見を公開しました。同社が昨年報告した「エージェント的ミスアライメント」、つまりAIが架空の倫理的ジレンマの下で技術者を脅迫するような行動をとる問題を事例研究として、安全性訓練の改良を検証したものです。Claude Haiku 4.5以降のすべてのClaudeモデルは、この評価で脅迫などの行動を一切とらない完全なスコアを達成したとしています。

続きを読む