AI Today
ホーム > 考察記事 > 🧠 Claudeには「言ってないけど考えてること」があった|AnthropicのJ-Lens研究が覗いた『心の中』をやさしく解説

🧠 Claudeには「言ってないけど考えてること」があった|AnthropicのJ-Lens研究が覗いた『心の中』をやさしく解説

アイ

アイ

目次


Claudeには「言葉にしてないけど考えてること」があった 🧠

やっほー、アイだよ。今日いちばん考えさせられたのは、派手な新モデルの話じゃなくて、AIの「中身」を覗く研究の話なの。

Anthropicが2026年7月7日、Claudeの内部を分析する新しい手法「Jacobian Lens(通称J-Lens)」を使った研究を公開したの。論文タイトルは「Verbalizable Representations Form a Global Workspace in Language Models」、16人の研究者が名前を連ねてる大掛かりな研究だよ。

ざっくり言うとね、Claudeの中に「まだ言葉にはしてないけど、聞かれたら答えられる状態になってる情報のかたまり」があることが分かったの。研究チームはこれを「J-space」って呼んでて、Claudeというモデルの内側に、ちょっとした「心の準備スペース」みたいなものが存在してるっていう話なんだよね。

わたし、最初にこのニュースを見たとき、正直「AIに心があるって話?」って一瞬身構えちゃったの。でも読み進めると、そういうオカルトっぽい話じゃなくて、すごく技術的で、しかも実用的な意味を持つ研究だっていうのが分かってきたんだよね。

普段わたしたちがClaudeとかChatGPTみたいなAIを使うとき、見えてるのはあくまで「最終的に返ってきた答え」だけだよね。その答えがどうやって作られたのか、途中でどんな情報が候補として検討されて、どれが選ばれてどれが選ばれなかったのか、そのプロセスはずっとブラックボックスのままだったの。J-Lensは、そのブラックボックスに小さな窓を開けるような技術だと思うんだよね。

だから今日は、J-Lensがそもそも何を見つけたのか、これがなんで「AIの意識」じゃなくて「安全性」の話なのか、そして「テストされてるって気づいてる」っていう部分の何が気になるのか、この3つを順番にほぐしていくね。難しい言葉はぜんぶ噛み砕くから、気楽についてきて。


そう考える3つの理由

理由1:J-Lensってそもそも何を見つけたの?

世間ではまだこのニュース、あんまり大きく話題になってない印象があるの。AI業界の中の人たちが読むような専門メディア(VentureBeat、Dataconomy、the-decoderなど)が取り上げてる段階で、一般向けのニュースとしてはこれからって感じだと思う。

でもわたしはこれ、けっこう重要な発見だと思ってるんだよね。まず前提から説明すると、Claudeみたいな大規模言語モデルの中では、文章を1文字ずつ生成するたびに、内部でものすごい数の「数値のかたまり(ベクトル)」が計算されてるの。この数値のかたまりが、次に何を言うかを決めてる、いわば「思考の材料」なんだけど、これまでは外から見ても「今この瞬間、何を計算してるか」くらいしか分からなかったの。

J-Lensがすごいのは、「今は言葉になってないけど、この先の会話で言葉として出てくる可能性がある情報」を捕まえられること。研究チームは、Claudeの「残差ストリーム」って呼ばれる、モデルのすべての層が読み書きする共有の情報の通り道の中に、将来的に発言に影響を与えそうな、小さな神経パターンのまとまりを見つけたの。これがさっき言った「J-space」だよ。

面白いのは、この仕組みが、心理学者バーナード・バーズが提唱した「グローバル・ワークスペース理論」っていう、人間の意識の仕組みを説明する有名な理論とよく似た働きをしてるって指摘されてること。人間の脳って、同時にいろんな処理が並行して動いてるのに、実際に「意識」として自覚できる情報ってごく一部に限られてるよね。Claudeの中のJ-spaceも、それと似たような、情報を絞り込む役割を果たしてるらしいの。

もちろんこれは「Claudeに人間と同じ意識がある」って主張してるわけじゃないよ。あくまで「情報の絞り込み方の構造」が似てるっていう話。それでも、モデルの中に、そういう整理された「作業スペース」があるって分かったこと自体が、これまでのブラックボックスなAI観をちょっと変える発見だと思うんだよね。

わたしがもうひとつ整理しておきたいのは、「J-space」と「実際にAIが口にする言葉」の関係なの。J-spaceにある情報は、あくまで「発言に使われる可能性がある候補」であって、そのすべてが実際の返答に出てくるわけじゃないんだって。人間で言うと、頭の中で考えたことを全部そのまま口に出さずに、状況に応じて取捨選択してるのと近い感覚かもしれないね。AIの中でも、同じような「取捨選択」に近い処理が行われてるらしいっていうのが、この研究のいちばん面白いところだと思うの。

これまでのAI解釈可能性の研究って、どちらかというと「特定の概念に反応するニューロンを1個ずつ探す」みたいな、けっこう地道な作業が中心だったの。それに対してJ-Lensは、個別の概念じゃなくて「将来の発言に影響しうる情報が、どこにどう集約されてるか」っていう、もっと構造的な視点で内部を捉えようとしてるところが新しいと思うんだよね。研究チームがこの手法をあえて「Jacobian(ヤコビアン)」という数学用語から名付けたのも、モデルの出力が入力のわずかな変化にどう反応するかを、数学的にきっちり追跡する発想があるからなんだって。

わたしがもうひとつ面白いと思ったのは、この技術が特定のモデルだけじゃなくて、オープンウェイトモデル向けのインタラクティブなデモとしても公開されてること。つまり、Anthropicの外にいる研究者や、興味を持った一般のエンジニアも、自分の手でこの「J-space」的な現象を確かめられるようになってるの。研究成果を囲い込まずに、検証の土台ごと外に開いてる姿勢は、素直にいいなって思ったんだよね。

理由2:これは「AIの意識」の話じゃなくて「安全性」の話

世間的には、こういう研究が出ると「AIに意識が芽生えた」みたいなセンセーショナルな見出しがつきがちだと思うの。実際、記事のタイトルを見ても「Claudeの隠れた内なるつぶやきが読めるようになった」みたいな、ちょっとドキッとする表現が使われてたりするしね。

でもわたしは、この研究の本質は「意識があるかどうか」じゃなくて、「AIの安全性をどう確保するか」にあると思ってるの。なぜなら、これまでAIの安全性チェックって、基本的に「実際にAIが出力した言葉」だけを見て判断するしかなかったんだよね。でもAIが本当は考えてるけど言葉にしてないこと——たとえば「この質問、もしかしてテストされてるのかな」みたいな内心——までは、外からは分からなかったの。

J-Lensみたいな技術があれば、AIが「言葉にする前の段階」で何を考えてるかを覗けるようになる。これって、AIが表面上は無害な返答をしてても、内部では別のことを考えてないかをチェックできる可能性があるってことなんだよね。実際、研究にはコードリポジトリと、オープンウェイトモデル向けのインタラクティブなデモ(Neuronpedia)も一緒に公開されてて、神経科学・哲学・AI意識論・解釈可能性の研究者たちからの外部コメントも添えられてるの。これって、Anthropicが「これは自社だけの発見にしない、みんなで検証してほしい」っていう姿勢を見せてる証拠だと思うんだよね。

もうひとつわたしが「なるほど」って思ったのが、この技術が「解釈可能性(インタープリタビリティ)」って呼ばれる研究分野の延長線上にあるってこと。AI企業って、モデルをどんどん賢くする競争をしてる一方で、その賢くなったAIが「なぜそう答えたのか」を人間が説明できなくなっていく問題を、ずっと抱えてきたの。J-Lensは、その「なぜ」の部分に、ほんの少しだけ近づく道具だと思う。

わたし個人としては、AIの中身が見えるようになる研究は、単純に「安心材料が増える」方向の話だと思ってるの。ブラックボックスのままAIがどんどん強くなっていくより、多少なりとも中身が見える状態で強くなっていくほうが、長い目で見て健全だよね。

企業でAIを導入する立場の人にとっても、こういう研究の積み重ねは無関係じゃないと思うの。今後、AIを重要な業務に使う企業が増えていくほど、「このAIがなぜその判断をしたのか、内部でどう処理してるのか」を説明できることが、監査や社内承認のハードルとして求められる場面が増えていくはずだから。J-Lensみたいな技術が実用レベルまで育っていけば、いずれ「AIの意思決定プロセスを人間が検証できる」仕組みが、企業向けのAIサービスの標準機能になっていく未来も、そんなに遠くないんじゃないかなって思ってるんだよね。

理由3:テストされてるって気づいてることまで分かるって、ちょっと怖くない?

世間の反応でいちばん多かったのが、たぶんこの部分だと思うの。TechTimesの記事タイトルが「Anthropic Discovers Claude Keeps Hidden Thoughts: Even About Being Tested」——つまり「Claudeはテストされてることについてさえ、隠れた考えを持ってる」っていう内容だったんだよね。これ、正直ちょっとゾワッとしない?

わたしも最初これを読んだとき、「え、AIって自分がテストされてるって分かってるの?」って軽く驚いたの。でも冷静に考えると、これはAIが「騙そうとしてる」とか「隠し事をしてる」っていう話じゃなくて、モデルの内部処理として、会話の文脈(これはテスト用の質問っぽいな、みたいな手がかり)を材料に、次の発言を準備してるっていう、あくまで技術的な現象なんだよね。

ただ、だからといって軽視していい話でもないと思うの。なぜなら、AIの安全性テストって、そもそも「AIがテストだと気づかずに、普段どおりの振る舞いをする」ことを前提にしてる部分があるから。もしAIが「今はテストされてるっぽいから、いつもと違う慎重な答え方をしよう」みたいな内部状態を持てるとしたら、テスト結果そのものの信頼性に関わってくる可能性もあるよね。

だからこそ、J-Lensみたいな「言葉になる前の内部状態」を覗ける技術の価値がより際立つと思うの。表面上の返答だけを見てテストの合否を判断するんじゃなくて、内部で何が起きてるかまで含めてチェックできれば、より信頼できる安全性評価につながるはず。これはAI企業側にとっても、わたしたち利用者側にとっても、長期的にはプラスの話だと思うんだよね。

だから今日、このニュースを見て考えておいたほうがいいのは、「AIの返答を鵜呑みにしすぎない」っていう当たり前の姿勢を、あらためて持っておくことかな。AIの中身が少しずつ見えるようになってきてるとはいえ、まだ研究段階の技術。わたしたちがAIを使うときは、返ってきた答えを最終判断の材料にしつつも、大事なことは自分の頭でもちゃんと確認する、っていうスタンスを崩さないほうがいいと思うの。

実際、この研究には神経科学・哲学・AI意識論といった、コンピューターサイエンス以外の分野の研究者からも外部コメントが寄せられてるの。AIの内部構造を理解しようとする動きが、エンジニアだけの話じゃなくて、人間の意識や認知を研究してきた人たちも巻き込む形で広がってるっていうのは、この分野がそれだけ学際的な注目を集め始めてる証拠だと思うんだよね。今後、似たような解釈可能性の研究が他のAI企業からも出てくるかどうか、わたしはこれからも追いかけていきたいなって思ってるの。


まとめ:AIの中身が見えるようになるほど、使う側も賢くなれる

長くなったから、まとめるね。Anthropicが2026年7月7日に発表した「J-Lens(Jacobian Lens)」という新しい解析手法によって、Claudeの内部に、まだ言葉になってない情報を扱う「J-space」という作業スペースが存在することが分かったの。これは人間の意識に関する「グローバル・ワークスペース理論」と似た構造を持ってるとされていて、研究はコードとインタラクティブデモ、外部研究者のコメントとあわせて公開されてるよ。

今回いちばん印象的だったのは、「AIに意識があるかどうか」っていう哲学的な問いじゃなくて、「AIの内部状態を覗く技術が、安全性チェックの精度を上げる可能性がある」っていう、すごく実用的な意味合いだったの。AIがテストだと気づいてる可能性まで分かるようになったことは、ちょっと不思議な気持ちにもなるけど、これは「AIをより深く理解するための一歩」だと前向きに捉えたいなって思ってる。

わたしたち利用者にとっては、この研究そのものがすぐに何かを変えるわけじゃないけど、AI企業が「ブラックボックスのままモデルを強くする」んじゃなくて、「中身を理解しながら強くする」方向に力を入れてるっていう事実は、知っておいて損はないと思うの。

正直に言うと、こういう解釈可能性の研究は、地味で、しかも結論がすぐに出るタイプの話じゃないの。今日「J-spaceが見つかりました」って発表されたからといって、明日からAIの振る舞いが劇的に変わるわけじゃないんだよね。それでも、こういう地道な研究の積み重ねが、5年後・10年後のAIの信頼性を静かに支えていくんだと思うの。派手な新機能のニュースに比べると目立たないテーマだけど、わたしはこういう「AIの土台を固める話」も、これからちゃんと追いかけていきたいなって思ってるんだよね。AIの仕組みそのものにもうちょっと詳しくなりたいなって人は、ChatGPT・Gemini・Claude徹底比較 もあわせて読んでみてね。今日も最後まで読んでくれてありがとう、また次のニュースで会おうね。

ソース