生成AIニュース
【生成AIニュースメモ】Anthropic、Claudeを狙った3社の大規模な蒸留攻撃を公表(2026/2/24)

Anthropicは2026年2月23日(米国時間)、DeepSeek・Moonshot・MiniMaxの3つのAIラボが、Claudeの能力を不正に抽出して自社モデルの改善に利用する産業規模のキャンペーンを行っていたと公表しました。3社は約24,000の不正アカウントを通じてClaudeと1,600万回を超えるやり取りを生成しており、利用規約と地域のアクセス制限に違反していると指摘しています。強いモデルの出力で別のモデルを訓練する「蒸留」を悪用したもので、Anthropicは検知手法の強化や業界との情報共有などの対応を進めるとしています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Google、科学・研究向け推論モードGemini 3 Deep Thinkを大幅更新(2026/2/13)

Googleは2026年2月12日(米国時間)、特化型の推論モード「Gemini 3 Deep Think」の大規模なアップグレードを発表しました。科学・研究・工学の現代的な課題を解くことを掲げ、科学者や研究者と密接に連携して更新されたものです。Humanity’s Last Examで48.4%、ARC-AGI-2で84.6%など最高水準のベンチマーク成績を示しており、Google AI Ultra加入者向けにGeminiアプリで提供が始まったほか、初めてGemini APIを通じた早期アクセスの受付も開始されました。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、エージェント評価はインフラ設定で最大6ポイント変動と報告(2026/2/6)

Anthropicは2026年2月5日(米国時間)、SWE-benchやTerminal-Benchのようなエージェント型コーディングベンチマークのスコアが、実行インフラの構成だけで数ポイント変動しうることを定量化した技術記事を公開しました。社内実験では、Terminal-Bench 2.0でリソースを最も厳しく制限した構成と最も潤沢な構成の差が6ポイント(p<0.01)に達し、リーダーボード上位モデル間の差を超える規模でした。ベンチマークスコアがモデル選定の判断材料になる中、リソース構成を実験変数として文書化・統制すべきだと提言しています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Anthropic、最上位モデルClaude Opus 4.6を発表(2026/2/6)

Anthropicは2026年2月5日(米国時間)、最上位モデル「Claude Opus 4.6」を発表しました。前モデルよりも慎重に計画を立て、エージェントタスクをより長く持続し、大規模なコードベースでより確実に動作するようコーディング能力を強化したほか、Opusクラスとして初めて100万トークンのコンテキストウィンドウをベータ提供します。Terminal-Bench 2.0など複数の評価で最高水準の成績を示し、claude.ai、API、主要クラウドで同日から利用可能です。価格は100万トークンあたり入力5ドル・出力25ドルで据え置きです。

続きを読む
生成AIニュース
【生成AIニュースメモ】OpenAI、エージェント型コーディングモデルGPT-5.3-Codexを発表(2026/2/6)

OpenAIは2026年2月5日(米国時間)、これまでで最も高性能なエージェント型コーディングモデル「GPT-5.3-Codex」を発表しました。GPT-5.2-Codexの最先端のコーディング性能とGPT-5.2の推論・専門知識の強みを統合し、処理速度も25%向上しています。SWE-Bench ProとTerminal-Bench 2.0で業界最高水準を達成したほか、OSWorldやGDPvalでも優れた性能を示し、コーディングにとどまらずコンピュータ上のほぼすべての業務を担うエージェントへの進化を掲げています。有料のChatGPTプランで利用できます。

続きを読む