AI

ループ型 Transformer は推論を隠すのか — GPT-6 Astra を運用者目線で読む

GPT-6 Astra が「ループする Transformer で思考を隠す」という見立ては構造の話としては誤りに近い。looped transformer と潜在推論を切り分け、運用者が本当に構えるべき監視可能性・コスト・推論時スケーリングの 3 点を整理します。

SoSoraEndo2026年9月10日 09:0710 min2,355 字

動画で読む

結論から: ループ型 Transformer は推論を隠す構造ではない

先に結論を書く。2026 年 9 月に出た GPT-6 Astra が「ループする Transformer(同じ層を何度も通す構造)で思考を隠している」という見立ては、少なくとも構造の話としてはほぼ誤りだ。層をループさせることと、モデルが思考を出力トークンに出すかどうかは、別のレイヤーの問題である。API を叩いて課金される側の運用者として気にすべきは、「推論が隠れたか」より監視可能性とコスト構造がどう変わるか。私はそう読んだ。

この記事は Sebastian Raschka の解説(2026 年 9 月 9 日公開)を土台に、looped transformer(ループ型 Transformer)と latent reasoning(潜在推論、出力に出さない内部推論)を運用者目線で並べ直す。憶測と構造の話を切り分けたい。

GPT-6 Astra で実際に起きたこと

まず事実から。GPT-6 Astra は 2026 年 9 月に出た OpenAI の最新フラッグシップで、ARC-AGI-3 で 99.9%(GPT-5.6 Sol の 7.8% に対して)という数字を出した。約 10 万台の NVIDIA Grace Blackwell で学習したとされ、とりわけ computer-use(GUI 越しにローカルのソフトを操作する能力)が強い。

騒ぎの発端は The Information の報道だった。Astra が「recurrent depth」つまりループ型 Transformer を採用している、という未確認情報だ。ここから「推論トレースが短くなったのは、ループで思考を内部に隠しているからでは」という憶測が一気に広がった。Raschka はこの因果を一度分解している。ループ化は事実かどうかも未確認で、仮に事実でもトレースが短い理由とは直結しない、と。

ループする Transformer とは何か

ループ型 Transformer は、別々の層を積み増す代わりに同じ層のブロックを複数回使い回し、パラメータ数を増やさずに実効的な深さ(計算の段数)を稼ぐ構造だ。深さは欲しいが重みは増やしたくない、という要求への答えである。

分かりやすい例が Nanbeige4.2-3B(2025 年 7 月)だ。22 個の Transformer ブロックを 2 周させる。ブロックの適用回数は 44 回だが、重みは 22 セット分しか持たない。展開すると「1→2→…→22→1→2→…→22」で、後半は前半とまったく同じ重みを使う。結果、ブロックのパラメータは 44 層構成に比べて約半分になる。

ただし、ここに運用上の落とし穴がある。減るのは「保存するパラメータ」だけで、forward / backward の計算量は 44 層相当のまま変わらない。KV キャッシュ(生成時に貯める中間状態)も減らない。周回ごとに別のキャッシュが要るからだ。Nanbeige の研究者は、周回間で KV キャッシュを共有したら性能が落ちたと報告している。余談だが、この「うまい話には裏がある」という注記を読んで、私は変に納得してしまった。パラメータが半分でも財布が半分になるわけではない。

系譜: Universal Transformers から Mixture-of-Recursions まで

この発想自体は新しくない。整理すると流れが見える。

手法出自要点
Universal Transformers20181 ブロックを繰り返し、adaptive halting でトークンごとに周回数を変える
Latent Reasoning (Geiping ら)2025 (3.5B)共有ブロックを挟み込み、各周回に元の入力を毎回連結する
Mixture-of-Recursions2025router でトークンごとに再帰の深さを割り当てる
Ouro (ByteDance)—48 ブロックを 4 周(192 回適用)、学習した exit gate で抜ける

Mixture-of-Recursions の論文(arXiv 2507.10524)が面白いのは、規模で結論が反転する点だ。135M パラメータの最小スケールでは通常の Transformer が勝つ。ところが規模を上げると、同じ学習計算量ならループ型のほうが loss が下がる。2026 年 9 月の SMELT は、計算量を揃えた比較でループ型が 6.8〜18% 少ない学習計算で済むと報告した。小さいうちは損、大きくなると得。これがループ型の素の姿だ。

「隠れ推論」はどこが誤解されやすいか

ループ型であることと、chain-of-thought(思考の連鎖)を隠すことは直接つながらない。短い推論トレースは、多くの場合ただの効率の表れだ。ここを混同すると話が全部ずれる。

推論モデルは答えの前に scratch-pad(下書き)トークンを吐く。そして賢いモデルほど、少ないトークンで解ける。Raschka が挙げる比較が分かりやすい。GPT-5.6 Luna は Sol と同等の性能を出すのに 80% 多くのトークンを使う。これはループ特有の現象ではなく、単純に問題解決の効率差だ。Astra のトレースが短いのも、試験の準備が万端の学生ほどメモ用紙を使わないのと同じ、と説明できる。

OpenAI のチーフサイエンティスト Jakub Pachocki も、Astra を含む現行フロンティアモデルの計算グラフの深さは GPT-4 の 2 倍以内に収まっており、CoT モニタリング(思考連鎖の監視)を重視していると述べた。同時に、状況が「望ましくない方向にも動いている」と認めてもいる。ここは運用者として素直に受け取っておきたい。

もう一つ、2026 年 8 月の Full-Bandwidth Transformer が示した所見が示唆的だ。latent feedback(潜在的なフィードバック機構)はベースモデルでは推論トレースを短くしたが、instruction tuning(指示チューニング)後にはその効果が消えた。つまりトレースが短くなるのは学習依存であって、構造で決まる現象ではない。「ループ型だから隠す」という単純な因果は、ここでも成り立たない。

API 利用者・運用者に効いてくること

運用者にとっての実害と実利は、3 つに絞れる。監視可能性、コスト構造、推論時スケーリングだ。順に見ていく。

第一に監視可能性。トレースが短くなると、出力トークンから意思決定を追う従来の監視は効きにくくなる。トークンを覗く以外の手立てを持っておく必要がある。ここはコーディング評価で signal と noise を切り分ける話(コーディング評価の signal と noise を運用者目線で切り分ける)と地続きで、出力だけを信じない設計が要る。

第二にコスト構造。減るのは保存パラメータで、推論時の計算量と KV キャッシュはほぼ変わらない。むしろ内部の周回数が増えると、出力トークン課金には現れないコストが乗る余地がある。API 側からは今のところ周回数は見えない。安くなると早合点しないほうがいい。

第三に推論時スケーリング。ここは素直に利点だ。adaptive routing(トークンごとの動的なルーティング)や variable loops で、難しいトークンにだけ深く計算を割り当てられる。Geiping らの latent reasoning(arXiv 2502.05171)は、推論時に周回数を変えることで 3.5B のモデルが 50B 相当の計算負荷まで性能を伸ばせると示した。サンプリングパラメータが軒並み無効化されていく流れ(Gemini 最新モデルで temperature / top_p / top_k が無視される)と同じく、推論の制御点が API の外へ移っていく動きの一部として読める。

私は Raschka の「Astra の強さは looping より学習レシピとデータが主因だろう」という見立てに同意する。理由は単純で、SMELT が示した効率差は数〜十数%のオーダーであり、ARC-AGI-3 の 7.8% から 99.9% への跳躍を構造だけで説明するには小さすぎるからだ。構造は効いている。ただし主役ではない。

まとめ

  • ループ型 Transformer はパラメータ効率のための構造であり、推論を隠す仕組みではない。減るのは保存パラメータだけで、計算量と KV キャッシュはほぼ変わらない。
  • 短い推論トレースは効率の表れで、規模が大きいほどトークンは減る。監視が難しくなるのは事実だが、それは構造ではなく学習と効率に由来する。
  • 運用者は監視可能性・コスト構造・推論時スケーリングの 3 点で構えておく。安くなると早合点せず、出力トークン以外の監視手段を持つこと。

Tags

よくある質問

ループ型 Transformer を使うと API のコストは下がりますか?
保存するパラメータは減りますが、推論時の計算量と KV キャッシュはほぼ変わりません。そのため API 課金が自動的に下がるわけではなく、内部の周回数が増えると出力トークンに現れないコストが乗る可能性もあります。
GPT-6 Astra は本当にループ型 Transformer なのですか?
2026 年 9 月時点で公式な確認はありません。The Information が recurrent depth の採用を報じましたが未確認で、Sebastian Raschka も looping が性能の主因とは限らないと指摘しています。
推論トレースが短くなったのは思考を隠しているからですか?
主因は効率です。賢いモデルほど少ないトークンで解けるため、トレースは自然に短くなります。ただし監視の観点では、出力から追える情報が減るのは事実です。
looped transformer は学習済みモデルに後付けできますか?
基本的にできません。最初からループ前提で学習する必要があり、周回数は重要なハイパーパラメータです。既存モデルにあとから被せるものではありません。

参考文献

  1. GPT-6 Astra, Looped Transformers, and Hidden Reasoning (Ahead of AI, Sebastian Raschka)
  2. Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation (arXiv 2507.10524)
  3. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach (Geiping et al., arXiv 2502.05171)
  4. Universal Transformers (Dehghani et al., arXiv 1807.03819)

Reaction

Share

X (Twitter)