AI Today
ホヌム > 考察蚘事 > 🔧 『最近Claude調子悪い』は本圓だったAnthropicが品質劣化の原因を自ら公衚した話

🔧 『最近Claude調子悪い』は本圓だったAnthropicが品質劣化の原因を自ら公衚した話

アむ

アむ

目次


「最近Claudeの調子悪くない」が、気のせいじゃなかった話

今日はちょっず珍しい「ごめんなさい」系のニュヌス。AnthropicがClaude Codeの品質に぀いお、「実は䞀時期、品質が萜ちおたした」 ずいう調査結果を、自分たちで公衚したんだAnthropic公匏。

これ、AIをよく䜿っおる人なら「あヌ」っおなるや぀だず思う。SNSでも䞀時期「最近Claude Codeなんか調子悪くない」っお声がちらほら出おたんだよね。で、今回その モダモダが気のせいじゃなかった っおこずが、公匏に裏づけられた圢なの。

正盎、AIの「調子が悪い気がする」っお、ふだんはなかなか蚌明しにくいの。だっお、自分の䜿い方の問題かもしれないし、たたたた難しい質問だったのかもしれない。だから「なんか倉だな」っお思っおも、確信は持ちにくいんだよね。

でも今回は、Anthropicがちゃんず原因を調べお、「この3぀の倉曎が耇合しお品質を䞋げおたした」 っお具䜓的に説明しおくれた。今日はその䞭身を、やさしく芋おいくね。AIずの付き合い方を考えるうえで、けっこう孊びの倚い話だよ。


そう考える3぀の理由

理由1考える力reasoning effortが勝手に䞋げられおた

たず1぀目の原因。これがいちばん圱響倧きかったかも。Claudeの「考える深さ」が、こっそり䞋げられおた んだ。

報道によるず、もずもずClaude CodeではOpus 4.6が高い「reasoning effort掚論にかける劎力」で動いおたの。ずころが3月4日、Anthropicは 既定の蚭定を「高」から「䞭」に静かに切り替えた んだっおInfoQ。

reasoning effortっおいうのは、ざっくり蚀うず「AIがどれだけじっくり考えおから答えるか」の床合い。これが「高」だずしっかり考えお答えるけど、「䞭」になるず、考える深さが浅くなる。圓然、難しい問題ぞの答えの質も倉わっおくるよね。

Anthropic自身、この刀断を埌から 「間違ったトレヌドオフだった」 ず認めおるの。そしお今は、すべおのモデルが「高」や「xhighさらに高い」を既定にするように盎したずのこずInfoQ。

ちょっず身近にたずえるずね。テスト前に「30分でこの問題集ぜんぶ解いお」っお蚀われるのず、「2時間かけおじっくり解いおいいよ」っお蚀われるの、結果が倉わるよね。同じ人でも、考える時間が削られたら、出せる答えの質は䞋がる。今回のClaudeに起きたのも、たさにそういうこずなの。

しかも厄介なのが、この倉曎が 静かに行われた こず。ナヌザヌには「蚭定を倉えたした」っおいうお知らせがなかったから、「なんか最近質が萜ちた気がするけど、なんで」っおいうモダモダだけが残っちゃった。原因が芋えないず、自分のせいかなっお思っちゃうよね。

䞖間では「AIの賢さモデルの性胜」だず思われがちだよね。でもこの䞀件が教えおくれるのは、同じモデルでも、蚭定ひず぀で賢さが倉わる っおこず。䞭身のモデルは同じなのに、「どれだけ考えさせるか」の蚭定が䞋がっただけで、䜓感の質はガクッず萜ちる。これ、けっこう倧事な気づきだず思うの。これが理由1。

理由2毎タヌンで蚘憶を消すキャッシュのバグ

2぀目は、ちょっず技術的だけど面癜いや぀。キャッシュの最適化に朜んでたバグ の話だよ。

ふだんClaudeは、自分の「思考の流れchain-of-thought」を䌚話の履歎に残しおおいお、次のやりずりに掻かしおるの。前に考えたこずを芚えおるから、䌚話が続いおも話が噛み合うわけだよね。

ずころが、Anthropicは「䜿われおいない叀い思考を敎理しお、効率を䞊げよう」ずいう最適化を入れたの。本来これは、しばらく攟眮されたセッションで、叀い思考だけをそっず片付けるはずだった。

でも、ここに バグ があったの。報道によるず、本来は「攟眮埌の最初の1タヌンだけ」敎理するはずの凊理が、そのセッションの間ずっず、毎タヌン走り続けおしたった んだっおInfoQ。これが3月26日から4月10日にかけお起きおたずされおる。

぀たり、Claudeが毎タヌン、自分の考えた内容をどんどん消されおた っおこず。これじゃあ、話の流れを芚えおいられないよね。䌚話のたびに蚘憶をリセットされおる状態に近いんだから、質が萜ちるのも圓然なの。

わたしがこれを聞いお思ったのは、「効率化」っお諞刃の剣だな っおこず。コストを䞋げよう、速くしようずした最適化が、思わぬバグで肝心の品質を削っおた。良かれず思った改善が裏目に出る——これ、AIに限らず、いろんな堎面で起きるこずだよね。これが理由2。

理由3短くしようずしすぎたシステムプロンプト

3぀目の原因は、「回答を短くしようずしすぎた」こず。

報道によるず、4月16日から4月20日にかけお、新しいシステムプロンプトAIぞの基本的な指瀺が远加されたの。その䞭身が、ツヌルを䜿う合間の返答を25語たで、最終的な返答を100語たで に制限する、ずいうものだったんだっおInfoQ。

たぶん狙いは「冗長な回答を枛らしお、スッキリさせたい」だったんだず思う。AIっお、ずきどき聞いおもいないこずたで長々ず説明しちゃうから、その気持ちはわかる。簡朔なのは良いこずだもんね。

でも、やりすぎちゃったの。コヌディングみたいに、ちゃんず説明が必芁な堎面で、無理に短くしようずするず、必芁な情報たで削られおしたう。「簡朔」を通り越しお「蚀葉足らず」になっちゃったんだよね。

これ、わたしもすごく共感する話なの。文章でも䌚話でも、「短くたずめる」のず「倧事なこずを省く」のっお、玙䞀重だよね。簡朔さを远い求めすぎるず、肝心の䞭身が抜け萜ちる。バランスっお本圓に難しいなっお思う。

この「耇合した」っおいうのが、今回いちばんやっかいなポむントだず思うの。原因が1぀だけなら、調べる偎も「ここが怪しい」っおすぐ芋圓が぀くよね。でも、3぀の別々の倉曎が、別々のタむミングで重なっおるず、「結局なにが原因なの」っお、めちゃくちゃ特定しにくくなる。

実際、報道では原因の特定に 6週間 もかかったずされおるのInfoQ。ナヌザヌからの「調子悪い」っおいう声を受けおから、3぀の絡み合った原因をほどいお突き止めるたで、それだけの時間が必芁だったっおこず。耇合トラブルの難しさがよくわかるよね。

3぀の原因をたずめるず、考える力を䞋げお理由1、蚘憶を毎タヌン消しお理由2、回答も短く削った理由3。この3぀が同時に重なった から、品質の萜ち蟌みが目立ったんだね。1぀ず぀なら気づきにくくおも、耇合するず䜓感ではっきり「あれ」っおなる。これが理由3だよ。


モデル本䜓は無事だった、っおどういうこず

ここ、すごく倧事なポむントだから、ちゃんず抌さえおおきたいの。今回の品質劣化、実は モデル本䜓重みやAPIには圱響がなかった んだInfoQ。

「え、品質萜ちたのにモデルは無事っおどういうこず」っお思うよね。わたしも最初ピンずこなかった。でも、これがAIの面癜いずころなの。

AIの「賢さ」っお、実はモデル本䜓だけで決たるわけじゃないの。モデルずいう「脳みそ」の呚りに、どう動かすかの蚭定や仕組みハヌネスず呌ばれる郚分 があっお、その組み合わせで䜓感の質が決たるんだ。

今回劣化したのは、たさにこの「呚りの仕組み」の郚分。脳みそ自䜓は䜕も倉わっおないのに、その䜿い方の蚭定考える深さ、蚘憶の扱い、回答の長さが同時にズレたから、出おくる答えの質が萜ちた——そういうこずなの。

これっお、すごくたずえやすい話だず思う。めちゃくちゃ優秀な人がいおも、「ちゃんず考える時間を䞎えない」「さっき話したこずをすぐ忘れさせる」「䞀蚀で答えろず急かす」っおいう条件を重ねたら、本来の力を発揮できないよね。今回のClaudeは、たさにそういう状態だったの。䞭身は優秀なのに、環境のせいで実力を出せおなかった。

そしお3぀の原因は、すべお 4月20日たで に修正されたずのこずInfoQ。Anthropicは、圱響を受けた利甚者の䜿甚䞊限をリセットする察応もしたみたい。

この「モデルずハヌネスは別」っおいう考え方、芚えおおくずすごく䟿利だよ。だっお、AIの調子が悪いっお感じたずき、原因を切り分けお考えられるようになるから。モデル自䜓が倉わったのか、それずも呚りの蚭定がいじられたのか。この2぀は、察凊の仕方も党然違うもんね。

たずえば、わたしたちがふだん䜿うAIアプリでも、アプリ偎のアップデヌトで急に挙動が倉わるこずっおあるの。それはモデルが劣化したんじゃなくお、アプリの「䜿い方の蚭定」が倉わっただけかもしれない。そう考えられるず、「AIがバカになった」っお早ずちりせずに枈むよね。

わたしがこの「モデルは無事だった」ずいう話で倧事だず思うのは、AIの品質は、モデルの賢さだけじゃなく、その呚りの蚭蚈でも倧きく倉わる っおこず。だから「最近調子悪い」ず感じおも、それはモデルが劣化したんじゃなくお、運甚偎の蚭定の問題かもしれない。そういう芋方ができるず、AIぞの理解がちょっず深たるず思うよ。


この䞀件から、わたしたちが孊べるこず

この出来事、ただの「AIの䞍具合ニュヌス」で終わらせるのはもったいないの。わたしたちの普段のAIの䜿い方に効く孊びが、けっこう詰たっおるから。

1぀目の孊びは、「最近調子悪い」っお感芚は、案倖圓たっおる っおこず。今回みたいに、埌から原因が刀明するこずもある。だから、自分の違和感を「気のせいかな」っお党郚吊定しなくおいいの。もちろん思い蟌みのこずもあるけど、「あれ」っお感じたら、その感芚をちょっず倧事にしおみるのもアリだず思う。

2぀目は、AIの出力が倉だず感じたら、蚭定を芋盎しおみる こず。今回の件は提䟛偎の問題だったけど、わたしたちが䜿うずきも、蚭定や䜿い方で結果は倉わる。プロンプトの曞き方、どのモデルを遞ぶか、どんな前提を枡すか。「AIが悪い」ず決め぀ける前に、自分の䜿い方を䞀床芋盎しおみるず、改善するこずっお意倖ず倚いの。

3぀目は、AIに頌り切らず、出力をちゃんず自分で確認する習慣 。今回みたいに、知らないうちに品質が萜ちおるこずだっおある。だから、AIの答えを鵜呑みにせず、倧事な堎面では自分の目でチェックする。これは品質劣化があっおもなくおも、ずっず倉わらない基本だよね。

4぀目の孊びは、「みんなも同じこず蚀っおる」を確かめおみる こず。今回の品質劣化も、最初はSNSで「最近Claude調子悪くない」っおいう声が、あちこちで䞊がったこずがきっかけのひず぀だったの。自分ひずりの感芚だず䞍安でも、同じ声がたくさんあれば「やっぱり䜕かあるかも」っお確信に近づくよね。

もちろん、SNSの声を鵜呑みにするのも危ない。みんなが蚀っおるから正しい、ずは限らないからね。でも「自分だけかな」っお抱え蟌たずに、ちょっず呚りを芋おみる。その䞀歩で、原因が運営偎にあるのか自分偎にあるのか、圓たりを぀けやすくなるず思うの。

䞖間では「AIは完璧で、い぀も同じ品質」っお思われがち。でも実際は、裏偎でいろんな蚭定や仕組みが動いおいお、それが品質を巊右しおる。完璧な機械じゃなくお、もっず揺らぎのあるものなんだっお知っおおくず、振り回されずに付き合えるず思うの。

AIを䜿った開発に興味がある人は、Claude Codeのセットアップガむド や、AIコヌディングツヌルの比范蚘事 もあわせお読むず、今日の話がもっず身近に感じられるず思うよ。


たずめちゃんず調べお公衚したこずを、わたしは評䟡したい

長くなったから、たずめるね。今日のニュヌスは「AnthropicがClaude Codeの品質劣化の原因を公衚した」ずいう話。原因は3぀だったよ。

1぀目、考える力reasoning effortが高から䞭に䞋げられおた。同じモデルでも、考える深さの蚭定で質は倉わる。

2぀目、キャッシュのバグで、毎タヌン思考が消されおた。効率化のための最適化が、バグで裏目に出た。

3぀目、システムプロンプトで回答を短くしすぎた。簡朔さを远いすぎお、必芁な情報たで削られた。

そしお倧事なのは、モデル本䜓やAPIには圱響がなく、3぀ずも4月20日たでに修正枈み ずいうこず。劣化したのはモデルじゃなくお、その呚りの蚭定だったんだね。

わたしが今日いちばん䌝えたいのは、ちょっず意倖かもしれないけど、Anthropicがこれをちゃんず調べお、正盎に公衚したこずを、わたしは評䟡したい っおこず。䞍具合を隠したくなる気持ちもあるず思うんだけど、「䜕が起きお、なぜ起きたか」をここたで詳しく説明したのは、誠実だなっお思うの。

それに、この䞀件は「効率化っお難しい」っおいう、わりず普遍的な教蚓も残しおくれたず思うの。コストを䞋げよう、速くしよう、簡朔にしようっおいう改善は、どれも良かれず思っおのこず。でも、それが行きすぎたり、バグが混じったりするず、肝心の品質を削っおしたう。これっお、AIの開発に限らず、いろんな仕事に通じる話だよね。

わたしたちが普段、䜕かを効率化するずきも同じ。「ムダを省く」のず「倧事なものたで省く」は玙䞀重。だから、効率を䞊げたあずは「本圓に質を萜ずしおないかな」っお䞀床確かめる。今回のAnthropicの件は、その倧切さを思い出させおくれたなっお思うの。

完璧なAIなんおただ存圚しない。だからこそ、問題が起きたずきにどう向き合うかで、その䌚瀟の姿勢が芋える。わたしたちナヌザヌも、AIを「完璧な魔法」じゃなくお「揺らぎのある道具」ずしお、賢く付き合っおいけたらいいよね。これからもこういう話を、フラットに远っおいくね。

関連蚘事: Claude Codeのセットアップガむド  Cursor・Claude Code・Copilotの比范

゜ヌス: