【生成AIニュースメモ】Anthropic、最上位モデルClaude Opus 4.6を発表(2026/2/6)
Anthropicは2026年2月5日(米国時間)、最上位モデル「Claude Opus 4.6」を発表しました。前モデルよりも慎重に計画を立て、エージェントタスクをより長く持続し、大規模なコードベースでより確実に動作するようコーディング能力を強化したほか、Opusクラスとして初めて100万トークンのコンテキストウィンドウをベータ提供します。Terminal-Bench 2.0など複数の評価で最高水準の成績を示し、claude.ai、API、主要クラウドで同日から利用可能です。価格は100万トークンあたり入力5ドル・出力25ドルで据え置きです。
【生成AIニュースメモ】Anthropic、並列ClaudeのチームによるCコンパイラ自律開発の実験を公開(2026/2/6)
Anthropicは2026年2月5日(米国時間)、複数のClaudeインスタンスが人間の介入なしに共有コードベース上で並列に働く「エージェントチーム」の実験を紹介するエンジニアリング記事を公開しました。SafeguardsチームのNicholas Carlini氏が、Opus 4.6を使う16体のエージェントに、RustによるC言語コンパイラをゼロから開発させたものです。約2,000回のClaude Codeセッションと2万ドルのAPIコストを経て、x86・ARM・RISC-VでLinux 6.9をビルドできる10万行のコンパイラが完成しました。
【生成AIニュースメモ】Anthropic、推論が長いほどAIの誤りは非一貫になるとの研究を公開(2026/2/3)
AnthropicのAlignment Scienceブログで2026年2月、AIシステムの失敗の性質を分析した研究「The Hot Mess of AI」が公開されました。2025年夏の第1期Anthropic Fellowsプログラムの一環として行われたもので、AIが失敗するとき、意図しない目標を体系的に追求する形で失敗するのか、それともどの目標も推進しない支離滅裂な行動で失敗するのかを問い、フロンティア推論モデルの誤りを系統的なバイアスと非一貫なバリアンスに分解して定量的に検証しています。タスクが難しく推論が長くなるほど、失敗は系統的なミスアラインメントよりも非一貫性に支配されるようになると報告しています。
【生成AIニュースメモ】Anthropic、AI支援がコーディング技能の習得に与える影響を検証(2026/1/30)
Anthropicは2026年1月29日(米国時間)、AI支援がコーディング技能の形成に与える影響を調べたランダム化比較試験の結果を発表しました。Pythonの実務経験がありPythonライブラリのTrioに不慣れなソフトウェアエンジニア52名に、AIありとなしで機能実装の課題に取り組ませ、直後にクイズで理解度を測定したところ、AI利用群のスコアは手書き群より統計的に有意に低くなりました。一方で作業時間の短縮はわずかにとどまり、統計的有意には達しませんでした。AIの使い方によって理解度に差が出ることも報告しています。
【生成AIニュースメモ】Anthropic、LLMの人格を安定させる「アシスタント軸」を特定(2026/1/20)
Anthropicは2026年1月19日(米国時間)、大規模言語モデルの「アシスタント」人格が内部でどのように表現されているかを調べた解釈可能性研究を発表しました。MATSとAnthropic Fellowsプログラムを通じて実施されたもので、Gemma 2 27B、Qwen 3 32B、Llama 3.3 70Bの3つのオープンウェイトモデルを対象に、275種類のキャラクター類型に対応する神経活動を抽出して「人格空間」を写像し、その主要な変動方向である「アシスタント軸」がアシスタントらしさを捉えることを見いだしました。軸上の活性を監視・制限することで、有害な出力につながる人格の逸脱を検知・抑制できるとしています。
