Deep Dive
🔬 Deep Dive|30年級の予想が2つ落ちた。報道はそれを1つにした
7月22日から23日にかけて、30年ほど未解決とされたグラフ理論の予想が、2つ別々に破られたという主張が出た。予想も、使われたモデルも、公開した人も違う。ところが24時間のうちに、複数の媒体がこの2つを1つの出来事として書き始めた。数学は、主張と検証を切り分けられる数少ない分野である。その分野で、伝播が検証を追い越す様子が観察できる記録になった。
1|最初に落ちたのは、フローの予想だった
7月22日、研究者のドミトリー・ルイビン氏が、Dinitz-Garg-Goemans予想の反例を公開した。GPT-5.6 Proとの対話で構成したもので、やり取りは4回だったと本人は説明している。
予想の土台にあるのは、ディニッツ、ガーグ、ゴーマンスによる結果である。分割して複数経路に流せるフローは、容量の超過を最大需要の分までに抑えれば、各需要が単一の経路を通る形に変換できる。争点は、それをコストを増やさずにできるかどうかだった。
示された反例はこうだ。分割を許した解のコストは58。許容範囲の容量超過に収まる単一経路の解は、どれもコストが60以上になる。差は2。予想が成り立たないことを示すには、これで足りる。
2|次に落ちたのは、別の予想だった
翌23日、Capyという研究エージェントがGraffiti予想284の反例を見つけたという投稿が出た。動いていたのはGrok 4.5 Mediumで、所要は8分、Slackでのやり取りの最中だったとされる。
Graffitiは、1980年代に数学者シェミオン・ファイトロヴィッチ氏が作った、予想を自動生成するプログラムである。284番はそこから出た予想の一つだ。
反例に使われたのはホフマン・シングルトングラフ。50頂点、7正則、内周5、直径2という、グラフ理論では広く知られた対象である。無名の構成物ではなく、教科書に載る側のグラフだ。
この投稿には、もう一つ読み取れることがある。元の投稿をSlackで共有したところ、Capyが自分でやってみると言い出した、という趣旨の記述がある。最初の主張が二つ目の引き金になった可能性を示すが、そう断定できるだけの材料はない。
3|17時間後、主語が変わった
7月23日、マスク氏が投稿した。Grok 4.5が、約30年未解決だったグラフ理論の予想を解いた、と。
元の投稿にあった限定が、ここで落ちている。実行したのはCapyというエージェントであり、その下で動いていたのがGrok 4.5 Mediumだった。要約の過程で、エージェントが消え、モデルが主語になった。
この区別は細かい話ではない。エージェントの設計、使える道具、探索の戦略が結果に効いているなら、それはモデル単体の性能ではない。逆に、モデルを差し替えても同じ結果が出るなら、モデルの手柄と言える。どちらなのかは、区別して記録していなければ後から確かめられない。
4|そして、2つが1つになった
同じ日、複数の媒体が両方を混ぜた。
ある記事は、マスク氏がGrok 4.5を称賛したという見出しを掲げながら、本文ではDinitz-Garg-Goemans予想の内容、つまり58対60のコスト差を説明していた。そのうえで、GPT-5も同じ問題を解いたと書いている。別の記事は、Graffiti予想284とホフマン・シングルトングラフで一貫して書いていた。
混ざる条件は揃っていた。どちらも「約30年」「グラフ理論」「AIが数分で」である。見出しの粒度では、区別する手がかりがない。
ここで失われるのは固有名詞だけではない。独立した2つの事例が1つに見えると、何回起きたのかが数えられなくなる。AIが数学に効いているかどうかは、まさにその回数と再現性で判断される種類の問いである。
5|確認とは、何をすることか
現時点で、どちらの反例も独立した検証を経ていない。査読を通った確認も出ていない。
反例の確認に必要な手順ははっきりしている。対象を厳密に再構成する。分割を許した場合の最適値を独立に計算する。単一経路の解を漏れなく列挙する。見落とした経路がないか確かめる。検証に使ったコードを公開する。さらに踏み込むなら、Leanのような証明支援系で形式化する。
ここには救いがある。反例は、定理の証明より確認しやすい。一つの具体物を提示し、それが条件を満たし結論を満たさないことを示せば足りるからだ。人手でも計算機でも追検証できる。
だからこそ、確認まで到達した事例は「AIが数学に効いた」という主張の中で最も強い証拠になる。逆に、確認を飛ばしたまま件数だけが増えると、一件あたりの証拠としての重みは下がっていく。
6|前稿から見ると、位置が違う
7月10日、本アカウントはGrok 4.5について、価格と配布網からAI労働基盤を取りに来たと書いた。能力ではなく流通の話だった。
今回の出来事は、その延長線上にない。問われているのは能力の宣伝でも流通でもなく、主張をどう確かめるかである。同じモデル名が出ていても、見るべき軸は変わっている。
次に見るもの
【1】どちらかの反例について、第三者による再現が公開されるか
【2】Leanなどでの形式化が出るか。出れば、確認の水準が一段上がる
【3】エージェントとモデルを区別した報告が定着するか、それとも主語がモデルに寄り続けるか
【4】ホフマン・シングルトングラフがGraffiti予想284の反例として成立するか、専門家の確認が出るか
編集メモ
本稿は2つの主張を別々の事象として扱った。根拠は、予想の名前、反例の対象、使われたモデル、公開した人、投稿時刻がすべて異なることである。投稿時刻はいずれも投稿IDから算出した。
ただし両者が無関係だと断定はしていない。二つ目の投稿には、最初の投稿を共有したという記述がある。
Capy側の公開者については、報じた媒体の間で人物の表記が割れているため、本稿では名前を書いていない。また本稿は、どちらの反例についても数学的な正しさを判定していない。
一次ソース
・Dmitry Rybin氏によるDinitz-Garg-Goemans予想の反例公開(2026年7月22日)
https://x.com/DmitryRybin1/status/2079904005652893709
・同、予想の背景説明
https://x.com/DmitryRybin1/status/2079907499545919968
・Capyによる Graffiti予想284 の反例公開(2026年7月23日)
https://x.com/justinsunyt/status/2080116559352316409
・イーロン・マスク氏による投稿(2026年7月23日)
https://x.com/elonmusk/status/2080165738464280725
・BigGo Finance(Grok見出しの下でDinitz-Garg-Goemansを説明し、GPT-5にも言及した例)
https://finance.biggo.com/news/470b3b6b-7dea-4bde-9b29-0d6a6bf12daf
・Windows News(Dinitz-Garg-Goemansとして報じ、確認手順の必要性を明示した例)
https://windowsnews.ai/article/ai-generated-counterexample-could-overturn-30-year-graph-theory-conjectureif-it-holds-up.440161
・logos-pres(Graffiti予想284とホフマン・シングルトングラフとして報じた例)
https://logos-pres.md/en/news/grok-4-5-helped-disprove-a-mathematical-hypothesis-that-had-remained-unresolved-for-about-30-years/
・前稿: Grok 4.5は「AI労働基盤」を取りに来た(2026年7月10日)
https://x.com/SITIONjp/status/2075400324802884010