2026年2月の生成AIニュースまとめ&理解度チェック6問
「G検定時事対策」は、その月の生成AIニュースからG検定に関わりの深いものを厳選し、要約・出題観点・理解度チェックの三点セットで振り返る月刊シリーズです。試験前の時事対策にも、合格後の月1回のAIキャッチアップにも使えます。理解度チェックはG検定の出題形式を模したオリジナル問題で、ニュースの内容を理解できたかを確認するためのものです(本試験の過去問・予想問題ではありません)。
① 今月の全体傾向
2026年2月は、Anthropic・OpenAI・Googleの3社がエージェント性能を軸にモデル更新を重ねた月でした。Claude Opus 4.6、GPT-5.3-Codex、Gemini 3 Deep Think更新と発表が続く一方、大規模な蒸留攻撃の公表、ベンチマークスコアの信頼性検証、AIの誤りの性質を分析する研究など、モデルを「測る・守る」側の話題が目立ったのも特徴です。国内ではJDLAが生成AI利用の法的論点を整理した報告書を公開しました。
- 🚀 フロンティアモデルの更新 — AnthropicのClaude Opus 4.6(Opusクラス初の100万トークンコンテキスト・価格据え置き)、OpenAIのGPT-5.3-Codex(エージェント型コーディング特化・25%高速化)、Googleの科学・研究向けGemini 3 Deep Think更新と、各社の発表が続きました。エージェントタスクへの対応強化が共通の軸です。
- 🤖 エージェントによる自律開発と評価の課題 — 16体の並列Claudeが人間の介入なしに、2万ドル弱のAPIコストでLinux 6.9をビルドできる10万行のRust製Cコンパイラを完成させました。一方でAnthropicは、エージェント型コーディングベンチマークのスコアがインフラ構成だけで最大6ポイント変動すると報告し、リーダーボードの小差を鵜呑みにしないよう提言しています。
- 🛡 セキュリティ・安全性の研究と事例 — AnthropicがDeepSeek・Moonshot・MiniMaxの3社による大規模な蒸留攻撃(約24,000の不正アカウント・1,600万件超のやり取り)を公表。研究面では、推論が長くなるほどAIの誤りは非一貫になるとのバイアス・バリアンス分解による分析が公開され、GPT-5.3-Codexはサイバーセキュリティ関連タスクで「High capability」に分類された初のモデルとなりました。
- ⚖ 国内の法・ガバナンス — JDLAが生成AIへの個人データ入力と著作権侵害リスクを整理した「法と技術の検討委員会報告書Ⅱ」を公開。一律禁止ではなく、一定の条件整理と利用段階の運用ルールでリスクを相当程度低減できるとの考え方を提言しました。
- 💼 業務への組み込みと来歴管理 — AnthropicはCoworkに金融向けプラグイン5種とFactSet・MSCIのMCPコネクタを追加し、ExcelとPowerPointをまたぐ一気通貫の金融業務に対応。Googleは画像生成モデルNano Banana 2で、電子透かしSynthIDとC2PAコンテンツクレデンシャルを組み合わせた来歴の明示を進めています。
② 各ニュースの概要(全10本)
2/3 JDLA、生成AIの個人データ入力と著作権リスクに関する報告書を公開✍️ チェック問題あり
- 日本ディープラーニング協会が生成AI利用の法的論点を整理した「法と技術の検討委員会報告書Ⅱ」を2月3日付で公開
- 生成AIへの個人データ入力は一律に禁止されるものではなく、一定の条件下では個人情報保護法上適法に行いうると整理
- 著作権侵害リスクは生成物の事後確認ではなく、使い方やプロンプト設計、社内ルールの整理で相当程度低減できるとの見解を提示
2/3 Anthropic、推論が長いほどAIの誤りは非一貫になるとの研究を公開✍️ チェック問題あり
- Anthropic Fellowsプログラムの研究者らが、AIの誤りを系統的なバイアスと非一貫なバリアンスに分解して分析する研究を公開
- タスクが難しく推論が長くなるほど、フロンティア推論モデルの失敗は系統的なミスアラインメントより非一貫な誤りに支配されると報告
- モデルの大規模化だけでは誤りの非一貫性は解消されず、報酬ハッキングや目標の誤指定を対象とする研究の相対的な重要性が増すと指摘
2/6 Anthropic、エージェント評価はインフラ設定で最大6ポイント変動と報告
- Anthropicがエージェント型コーディングベンチマークのスコアがインフラ構成だけで変動することを定量化
- Terminal-Bench 2.0ではリソース制限が最も厳しい設定と無制限の設定の間で6ポイントの差(p<0.01)が生じた
- リソースは保証割当と強制終了上限を分けて指定し、リーダーボードの3ポイント未満の差は構成が判明するまで懐疑的に見るべきと提言
2/6 Anthropic、最上位モデルClaude Opus 4.6を発表✍️ チェック問題あり
- AnthropicがClaude Opus 4.6を発表し、コーディング能力や長時間のエージェントタスク、大規模コードベースへの対応を強化
- Opusクラスとして初めて100万トークンのコンテキストウィンドウをベータ提供し、長文脈の検索・推論を大幅に改善
- Terminal-Bench 2.0など複数のベンチマークで最高水準を達成し、価格は据え置きで同日から提供開始
2/6 OpenAI、エージェント型コーディングモデルGPT-5.3-Codexを発表
- OpenAIがこれまでで最も高性能なエージェント型コーディングモデルGPT-5.3-Codexを発表し、SWE-Bench ProとTerminal-Bench 2.0で最先端の性能を達成
- コードの記述やレビューにとどまらず、スライド作成やデータ分析などコンピュータ上の幅広い業務を担うエージェントへ進化
- サイバーセキュリティ関連タスクで「High capability」に分類された初のモデルで、これまでで最も包括的な安全対策とともに提供
2/6 Anthropic、並列ClaudeのチームによるCコンパイラ自律開発の実験を公開✍️ チェック問題あり
- 複数のClaudeが人間の介入なしに共有コードベースで並列に作業する「エージェントチーム」の実験結果を公開
- 16体のエージェントが約2,000セッション・2万ドル弱のAPIコストで、Linux 6.9をビルドできる10万行のRust製Cコンパイラを完成させた
- 高品質なテストの整備やモデルの限界を踏まえた環境設計など、長時間の自律開発を支えるハーネス設計の知見を共有
2/13 Google、科学・研究向け推論モードGemini 3 Deep Thinkを大幅更新
- 科学・研究・工学の課題解決に向けて、特化型推論モード「Gemini 3 Deep Think」を大規模アップグレード
- Humanity’s Last Examで48.4%、ARC-AGI-2で84.6%、CodeforcesでElo 3455など最高水準の成績を達成
- Google AI Ultra加入者向けにGeminiアプリで提供開始、初めてGemini API経由の早期アクセス受付も開始
2/24 Anthropic、Claudeを狙った3社の大規模な蒸留攻撃を公表✍️ チェック問題あり
- DeepSeek・Moonshot・MiniMaxの3社が約24,000の不正アカウントで1,600万件超のやり取りを生成し、Claudeの能力を不正に抽出していたと特定
- 不正に蒸留されたモデルは安全対策を欠いたまま能力が拡散するため、国家安全保障上のリスクや輸出規制の骨抜きにつながると指摘
- 分類器による検知、業界・当局との情報共有、アクセス管理の強化、蒸留の効果を下げる対抗策の開発などで対応
2/25 Anthropic、Coworkを更新し金融向けプラグインを拡充
- Coworkを更新し、Anthropic製5種とパートナー製の金融向けプラグイン、FactSet・MSCIの新MCPコネクタを追加
- ClaudeがExcelとPowerPointの間でコンテキストを保ったまま金融業務を一気通貫で実行可能に(全有料プランで研究プレビュー)
- 財務分析・投資銀行・株式リサーチ・プライベートエクイティ・ウェルスマネジメントの各業務に特化したプラグインを公開リポジトリで提供
2/27 Google、最新の画像生成モデルNano Banana 2を発表✍️ チェック問題あり
- Nano Banana Proの高度な世界知識・品質・推論をFlashの速度で提供する最新画像生成モデル(Gemini 3.1 Flash Image)を発表
- 最大5キャラクター・14オブジェクトの一貫性維持や512pxから4Kまでの解像度対応など、制作向けの機能を強化
- Geminiアプリ・検索・AI Studio・Gemini API・Flow・Google広告など、Google製品全体へ展開を開始
③ 試験にどう出るか&理解度チェック6問
Q1. JDLA、生成AIの個人データ入力と著作権リスクに関する報告書を公開→ 詳細メモ
個人情報保護法や著作権と生成AIの関係は「AIに関する法律・倫理」領域(AIガバナンス)の定番テーマです。生成AIへの個人データ入力の適法性や、著作権侵害リスクへの実務的な向き合い方について、国内の委員会報告書が示した考え方が問われ得ます。
2026年2月に日本ディープラーニング協会(JDLA)が公開した「法と技術の検討委員会報告書Ⅱ」が示した内容として、最も適切なものはどれか。
- A. 生成AIへの個人データの入力は、個人情報保護法により例外なく全面的に禁止されると整理した。
- B. 生成AIへの個人データ入力は一定の条件下では個人情報保護法上適法に行いうるとし、著作権侵害リスクは生成物の事後確認ではなく、使い方やプロンプト設計、社内ルールの整理といった利用段階の対応で相当程度低減できるとの考え方を示した。
- C. AI生成物の著作権侵害リスクには、生成物のすべてを人の目で個別に確認することによってのみ対応できるとした。
- D. 本報告書は法的拘束力を持ち、企業・組織は記載されたルールの遵守を義務付けられるとした。
答えと解説を見る
正解はBです。報告書は、企業で広く見られる「生成AIへの個人情報入力禁止」という一律的な運用に対し、生成AIサービスの技術的特性や契約条件等を踏まえれば、一定の条件下では個人データの入力を個人情報保護法上適法に行いうる場合があると整理しました。また著作権侵害リスクについては、AI生成物のすべてを個別に確認することは不可能になりつつあり、人の目による事後確認は合理的でない場合があるとして、生成AIの使い方やプロセス、プロンプト設計、社内ルールの整理といった利用段階での対応が最重要としています。Aは一律禁止ではないとする報告書の趣旨と逆であり、Cは事後確認に依存しない考え方と矛盾します。報告書は法的拘束力を持たず、最終判断は各企業・組織が行うべきものと位置づけられているためDも誤りです。
Q2. Anthropic、推論が長いほどAIの誤りは非一貫になるとの研究を公開→ 詳細メモ
誤差をバイアスとバリアンスに分解する考え方は「機械学習の具体的手法」領域で問われる基本の統計概念です。このニュースはその古典的な枠組みをフロンティア推論モデルの失敗分析に応用した例で、バイアス(系統的な誤り)とバリアンス(非一貫な誤り)の違いを整理しておきましょう。
Anthropicが2026年2月に公開した、AIシステムの失敗の性質を分析した研究の内容として、最も適切なものはどれか。
- A. モデルの規模を拡大しさえすれば、誤りの非一貫性は自動的に解消されると結論づけた。
- B. 推論やアクションが長くなるほど、誤りは一貫した系統的なものになると報告した。
- C. 誤りが発生する頻度そのものを「誤りの非一貫性」と定義し、誤りの中身の組成は考慮しなかった。
- D. 誤差をバイアスの2乗とバリアンスの和に分解する枠組みを用い、誤差に占めるバリアンスの割合を「誤りの非一貫性」と定義した上で、推論やアクションが長くなるほど誤りは非一貫になると報告した。
答えと解説を見る
正解はDです。この研究は、誤差をバイアスの2乗とバリアンスの和に分解する古典的な枠組みを用い、バイアスは一貫して同じ誤った結果に至る系統的な誤りを、バリアンスは試行ごとにばらつく非一貫な誤りを捉えるものとして、誤差に占めるバリアンスの割合を「誤りの非一貫性」と定義しました。その上で、推論トークン数・エージェントの行動数・最適化ステップ数のいずれで測っても、長くなるほど誤りが非一貫になることを全タスク・全モデルで確認しています。規模の拡大だけでは誤りの非一貫性は解消されないと示唆されているためAは誤りで、推論が長いほど誤りはむしろ非一貫になるためBも誤りです。この指標は誤りの頻度ではなく誤りの中身の組成を測るものなのでCも誤りです。バイアスとバリアンスの分解は、モデルの汎化性能を論じる際にも使われるG検定頻出の統計概念です。
Q3. Anthropic、最上位モデルClaude Opus 4.6を発表→ 詳細メモ
フロンティアモデルの最新動向は「生成AI・大規模言語モデル」領域の時事的な出題ポイントです。コンテキストウィンドウの拡大や長時間のエージェントタスクへの対応強化など、モデル進化の方向性を具体的な発表内容とあわせて押さえましょう。
Anthropicが2026年2月に発表した最上位モデル「Claude Opus 4.6」に関する記述として、最も適切なものはどれか。
- A. コーディング能力や長時間のエージェントタスクへの対応を強化し、Opusクラスとして初めて100万トークンのコンテキストウィンドウをベータ提供する。
- B. 価格は従来から大幅に引き上げられ、通常利用でも入力・出力ともに従来の2倍となった。
- C. 提供はAPI経由のみで、claude.aiなどの一般向けサービスでは利用できない。
- D. 拡張思考はユーザーが手動でオン・オフを切り替える方式のみで、モデル自身が使いどころを判断する機能は搭載されていない。
答えと解説を見る
正解はAです。Claude Opus 4.6は、前モデルよりも慎重に計画を立て、エージェントタスクをより長く持続し、大規模なコードベースでより確実に動作するようコーディング能力を強化したモデルで、Opusクラスとして初めて100万トークンのコンテキストウィンドウをベータ提供します。価格は100万トークンあたり入力5ドル・出力25ドルで従来から据え置きのためBは誤りです(20万トークンを超えるプロンプトに限りプレミアム価格が適用されます)。claude.ai、Claude API、主要なクラウドプラットフォームで発表当日から利用できるためCも誤りです。また、拡張思考のオン・オフの二択に代わり、深い推論が役立つ場面をモデル自身が文脈から判断する「アダプティブ思考」が導入されているためDも誤りです。コンテキストウィンドウとは、モデルが一度に扱える入力の長さのことです。
Q4. Anthropic、並列ClaudeのチームによるCコンパイラ自律開発の実験を公開→ 詳細メモ
複数のAIエージェントが協調して働くマルチエージェントの構成は「AIエージェント」領域で注目度が高いテーマです。人間の介入なしに長時間の自律開発を続けさせるためのハーネス設計の工夫と、その成果・限界を事例として押さえましょう。
Anthropicが2026年2月に公開した、複数のClaudeが並列に働く「エージェントチーム」によるCコンパイラ開発実験に関する記述として、最も適切なものはどれか。
- A. 中央のオーケストレーション用エージェントが各エージェントにタスクを割り当てる集中管理型の構成が採用された。
- B. 完成したコンパイラのコード品質は、熟練したRustプログラマの成果と同等以上と評価された。
- C. 16体のエージェントが人間の介入なしに共有コードベースで並列に作業し、約2,000セッション・2万ドル弱のAPIコストで、Linux 6.9をビルドできる10万行のRust製Cコンパイラを完成させた。
- D. 各エージェントはインターネット上の既存コンパイラのソースコードを参照しながら実装を進めた。
答えと解説を見る
正解はCです。この実験では、1つのタスクを終えるとすぐに次のタスクを拾う単純なループでClaude Codeを回し続けるハーネスを構築し、Opus 4.6を使う16体のエージェントが共有のgitリポジトリ上で並列に作業しました。約2,000回のセッションと2万ドル弱のAPIコストを経て、x86・ARM・RISC-VでLinux 6.9をビルドできる10万行のコンパイラが完成しています。オーケストレーション用のエージェントは用意されておらず、それぞれのClaudeが次に取り組む課題を自分で判断する構成のためAは誤りです。コード品質は妥当な水準だが熟練したRustプログラマの成果には遠く及ばないとされているためBも誤りです。開発中は一切インターネットにアクセスしていないクリーンルーム実装のためDも誤りです。自律稼働を支える設計の要点として、検証器がほぼ完全でないと誤った問題を解いてしまうため、極めて高品質なテストの整備が最重要とされています。
Q5. Anthropic、Claudeを狙った3社の大規模な蒸留攻撃を公表→ 詳細メモ
蒸留は大きなモデル(教師)の出力で小さなモデル(生徒)を訓練する正当な軽量化手法として「ディープラーニングの手法」領域で問われますが、このニュースは他社モデルからの不正な能力抽出(モデル窃取)に悪用された事例です。手法の定義と、セキュリティ・知財上のリスクの両面から出題され得ます。
Anthropicが2026年2月に公表した、Claudeを標的とする「蒸留攻撃」に関する記述として、最も適切なものはどれか。
- A. 3つのAIラボが約24,000の不正アカウントを通じてClaudeと1,600万回を超えるやり取りを生成し、強力なモデルの出力でより能力の低いモデルを訓練する「蒸留」の手法で能力を不正に抽出していたと特定された。
- B. 蒸留はモデルの重みを直接コピーする手法であり、APIの出力からモデルの能力を学習させることはできない。
- C. 攻撃は単一のアカウントから行われていたため、そのアカウントを停止するだけで完全に遮断できた。
- D. 蒸留はそれ自体が常に不正な行為であり、正当な用途は存在しないと説明された。
答えと解説を見る
正解はAです。AnthropicはDeepSeek・Moonshot・MiniMaxの3社が、約24,000の不正アカウントを通じてClaudeと1,600万回を超えるやり取りを生成し、エージェント的な推論、ツール使用、コーディングといった能力を標的に不正な抽出を行っていたと特定しました。蒸留は強力なモデルの出力を教師データとしてより能力の低いモデルを訓練する手法であり、重みの直接コピーではなくAPIの出力からでも能力を学習できるためBは誤りです。攻撃には「ハイドラクラスター」と呼ばれる不正アカウント網でトラフィックを分散させる商用プロキシサービスが使われ、あるプロキシ網は2万を超える不正アカウントを同時に管理していたとされるためCも誤りです。蒸留自体は広く使われる正当な訓練方法と説明されており、Dも誤りです。不正に蒸留されたモデルは安全対策を欠いたまま能力が拡散するため、国家安全保障上のリスクが指摘されています。
Q6. Google、最新の画像生成モデルNano Banana 2を発表→ 詳細メモ
画像生成モデルの進化とあわせて、生成物の来歴を明示する技術は「AIの社会実装・ガバナンス」領域で重要性が増しているテーマです。電子透かし(SynthID)とC2PAコンテンツクレデンシャルによる来歴管理の枠組みを、このニュースを例に押さえましょう。
Googleが2026年2月に発表した画像生成モデル「Nano Banana 2」と生成物の来歴管理に関する記述として、最も適切なものはどれか。
- A. 生成された画像に来歴を示す仕組みは導入されておらず、AIが使われたかどうかを利用者が確かめる手段は提供されない。
- B. SynthIDは生成画像の解像度を高めるための超解像技術である。
- C. Nano Banana 2は画像内のテキスト描画に対応しておらず、文字を含む画像は生成できない。
- D. 電子透かし技術SynthIDと相互運用可能なC2PAコンテンツクレデンシャルを組み合わせ、AIが使われたかどうかだけでなく、どのように使われたかまで含めた文脈を利用者に提供するとしている。
答えと解説を見る
正解はDです。Googleは生成メディアの進化に合わせ、電子透かし技術SynthIDと相互運用可能なC2PAコンテンツクレデンシャルを組み合わせることで、AIが使われたかどうかだけでなく、どのように使われたかまで含めた全体的な文脈を利用者に提供するとしています。GeminiアプリのSynthID検証機能はこれまでに2,000万回以上使われており、C2PA検証も近くGeminiアプリに追加される予定です。来歴を明示する仕組みが用意されているためAは誤りで、SynthIDはAI生成物に埋め込む電子透かしの技術であり超解像技術ではないためBも誤りです。Nano Banana 2はマーケティング用モックアップなどに向けた正確で判読可能なテキストの生成や、画像内テキストの翻訳・ローカライズに対応しているためCも誤りです。Nano Banana 2はGemini 3.1 Flash Imageとも表記され、上位版Nano Banana Proの世界知識・品質・推論をFlash譲りの高速性で提供する最新の画像生成モデルです。
時事対策とあわせて、クイズと体系的なテキストで合格力を仕上げましょう。
