【生成AIニュースメモ】Anthropic、Claude内部の思考領域「J-space」を発見(2026/7/7)
2026年7月7日
Anthropicは2026年7月6日、Claudeのような言語モデルの内部に、人間の「意識的にアクセスできる思考」に似た特別な役割を果たす神経活動パターンの集まり「J-space」が存在するとする研究論文を公開しました。J-spaceは特定の語に対応する内部表現の集合で、モデルが言葉を出力せずに概念について考えることを可能にします。同社が設計したものではなく訓練の過程で自然に出現したもので、神経科学のグローバルワークスペース理論と対応づけて分析されています。
【生成AIニュースメモ】Anthropic、AIの内部表現を文章に変換する手法「NLA」を発表(2026/5/8)
2026年5月8日
Anthropicは2026年5月7日、AIモデル内部の活性(アクティベーション)を自然言語の文章に変換して直接読めるようにする解釈可能性の手法「Natural Language Autoencoders(NLA)」を発表しました。モデルが言葉にしない内心の思考を文章として取り出せるのが特徴で、すでにClaudeの安全性テストや隠れた動機の監査に活用されています。論文とコードが公開されているほか、Neuronpediaとの協力により、複数のオープンモデルでNLAを試せる対話型デモも提供されています。
