動画で読む
結論から: ループ型 Transformer は推論を隠す構造ではない
先に結論を書く。2026 年 9 月に出た GPT-6 Astra が「ループする Transformer(同じ層を何度も通す構造)で思考を隠している」という見立ては、少なくとも構造の話としてはほぼ誤りだ。層をループさせることと、モデルが思考を出力トークンに出すかどうかは、別のレイヤーの問題である。API を叩いて課金される側の運用者として気にすべきは、「推論が隠れたか」より監視可能性とコスト構造がどう変わるか。私はそう読んだ。
この記事は Sebastian Raschka の解説(2026 年 9 月 9 日公開)を土台に、looped transformer(ループ型 Transformer)と latent reasoning(潜在推論、出力に出さない内部推論)を運用者目線で並べ直す。憶測と構造の話を切り分けたい。
GPT-6 Astra で実際に起きたこと
まず事実から。GPT-6 Astra は 2026 年 9 月に出た OpenAI の最新フラッグシップで、ARC-AGI-3 で 99.9%(GPT-5.6 Sol の 7.8% に対して)という数字を出した。約 10 万台の NVIDIA Grace Blackwell で学習したとされ、とりわけ computer-use(GUI 越しにローカルのソフトを操作する能力)が強い。
騒ぎの発端は The Information の報道だった。Astra が「recurrent depth」つまりループ型 Transformer を採用している、という未確認情報だ。ここから「推論トレースが短くなったのは、ループで思考を内部に隠しているからでは」という憶測が一気に広がった。Raschka はこの因果を一度分解している。ループ化は事実かどうかも未確認で、仮に事実でもトレースが短い理由とは直結しない、と。
ループする Transformer とは何か
ループ型 Transformer は、別々の層を積み増す代わりに同じ層のブロックを複数回使い回し、パラメータ数を増やさずに実効的な深さ(計算の段数)を稼ぐ構造だ。深さは欲しいが重みは増やしたくない、という要求への答えである。
分かりやすい例が Nanbeige4.2-3B(2025 年 7 月)だ。22 個の Transformer ブロックを 2 周させる。ブロックの適用回数は 44 回だが、重みは 22 セット分しか持たない。展開すると「1→2→…→22→1→2→…→22」で、後半は前半とまったく同じ重みを使う。結果、ブロックのパラメータは 44 層構成に比べて約半分になる。
ただし、ここに運用上の落とし穴がある。減るのは「保存するパラメータ」だけで、forward / backward の計算量は 44 層相当のまま変わらない。KV キャッシュ(生成時に貯める中間状態)も減らない。周回ごとに別のキャッシュが要るからだ。Nanbeige の研究者は、周回間で KV キャッシュを共有したら性能が落ちたと報告している。余談だが、この「うまい話には裏がある」という注記を読んで、私は変に納得してしまった。パラメータが半分でも財布が半分になるわけではない。
系譜: Universal Transformers から Mixture-of-Recursions まで
この発想自体は新しくない。整理すると流れが見える。
| 手法 | 出自 | 要点 |
|---|---|---|
| Universal Transformers | 2018 | 1 ブロックを繰り返し、adaptive halting でトークンごとに周回数を変える |
| Latent Reasoning (Geiping ら) | 2025 (3.5B) | 共有ブロックを挟み込み、各周回に元の入力を毎回連結する |
| Mixture-of-Recursions | 2025 | router でトークンごとに再帰の深さを割り当てる |
| Ouro (ByteDance) | — | 48 ブロックを 4 周(192 回適用)、学習した exit gate で抜ける |
Mixture-of-Recursions の論文(arXiv 2507.10524)が面白いのは、規模で結論が反転する点だ。135M パラメータの最小スケールでは通常の Transformer が勝つ。ところが規模を上げると、同じ学習計算量ならループ型のほうが loss が下がる。2026 年 9 月の SMELT は、計算量を揃えた比較でループ型が 6.8〜18% 少ない学習計算で済むと報告した。小さいうちは損、大きくなると得。これがループ型の素の姿だ。
「隠れ推論」はどこが誤解されやすいか
ループ型であることと、chain-of-thought(思考の連鎖)を隠すことは直接つながらない。短い推論トレースは、多くの場合ただの効率の表れだ。ここを混同すると話が全部ずれる。
推論モデルは答えの前に scratch-pad(下書き)トークンを吐く。そして賢いモデルほど、少ないトークンで解ける。Raschka が挙げる比較が分かりやすい。GPT-5.6 Luna は Sol と同等の性能を出すのに 80% 多くのトークンを使う。これはループ特有の現象ではなく、単純に問題解決の効率差だ。Astra のトレースが短いのも、試験の準備が万端の学生ほどメモ用紙を使わないのと同じ、と説明できる。
OpenAI のチーフサイエンティスト Jakub Pachocki も、Astra を含む現行フロンティアモデルの計算グラフの深さは GPT-4 の 2 倍以内に収まっており、CoT モニタリング(思考連鎖の監視)を重視していると述べた。同時に、状況が「望ましくない方向にも動いている」と認めてもいる。ここは運用者として素直に受け取っておきたい。
もう一つ、2026 年 8 月の Full-Bandwidth Transformer が示した所見が示唆的だ。latent feedback(潜在的なフィードバック機構)はベースモデルでは推論トレースを短くしたが、instruction tuning(指示チューニング)後にはその効果が消えた。つまりトレースが短くなるのは学習依存であって、構造で決まる現象ではない。「ループ型だから隠す」という単純な因果は、ここでも成り立たない。
API 利用者・運用者に効いてくること
運用者にとっての実害と実利は、3 つに絞れる。監視可能性、コスト構造、推論時スケーリングだ。順に見ていく。
第一に監視可能性。トレースが短くなると、出力トークンから意思決定を追う従来の監視は効きにくくなる。トークンを覗く以外の手立てを持っておく必要がある。ここはコーディング評価で signal と noise を切り分ける話(コーディング評価の signal と noise を運用者目線で切り分ける)と地続きで、出力だけを信じない設計が要る。
第二にコスト構造。減るのは保存パラメータで、推論時の計算量と KV キャッシュはほぼ変わらない。むしろ内部の周回数が増えると、出力トークン課金には現れないコストが乗る余地がある。API 側からは今のところ周回数は見えない。安くなると早合点しないほうがいい。
第三に推論時スケーリング。ここは素直に利点だ。adaptive routing(トークンごとの動的なルーティング)や variable loops で、難しいトークンにだけ深く計算を割り当てられる。Geiping らの latent reasoning(arXiv 2502.05171)は、推論時に周回数を変えることで 3.5B のモデルが 50B 相当の計算負荷まで性能を伸ばせると示した。サンプリングパラメータが軒並み無効化されていく流れ(Gemini 最新モデルで temperature / top_p / top_k が無視される)と同じく、推論の制御点が API の外へ移っていく動きの一部として読める。
私は Raschka の「Astra の強さは looping より学習レシピとデータが主因だろう」という見立てに同意する。理由は単純で、SMELT が示した効率差は数〜十数%のオーダーであり、ARC-AGI-3 の 7.8% から 99.9% への跳躍を構造だけで説明するには小さすぎるからだ。構造は効いている。ただし主役ではない。
まとめ
- ループ型 Transformer はパラメータ効率のための構造であり、推論を隠す仕組みではない。減るのは保存パラメータだけで、計算量と KV キャッシュはほぼ変わらない。
- 短い推論トレースは効率の表れで、規模が大きいほどトークンは減る。監視が難しくなるのは事実だが、それは構造ではなく学習と効率に由来する。
- 運用者は監視可能性・コスト構造・推論時スケーリングの 3 点で構えておく。安くなると早合点せず、出力トークン以外の監視手段を持つこと。
Tags
よくある質問
- ループ型 Transformer を使うと API のコストは下がりますか?
- 保存するパラメータは減りますが、推論時の計算量と KV キャッシュはほぼ変わりません。そのため API 課金が自動的に下がるわけではなく、内部の周回数が増えると出力トークンに現れないコストが乗る可能性もあります。
- GPT-6 Astra は本当にループ型 Transformer なのですか?
- 2026 年 9 月時点で公式な確認はありません。The Information が recurrent depth の採用を報じましたが未確認で、Sebastian Raschka も looping が性能の主因とは限らないと指摘しています。
- 推論トレースが短くなったのは思考を隠しているからですか?
- 主因は効率です。賢いモデルほど少ないトークンで解けるため、トレースは自然に短くなります。ただし監視の観点では、出力から追える情報が減るのは事実です。
- looped transformer は学習済みモデルに後付けできますか?
- 基本的にできません。最初からループ前提で学習する必要があり、周回数は重要なハイパーパラメータです。既存モデルにあとから被せるものではありません。
参考文献
- GPT-6 Astra, Looped Transformers, and Hidden Reasoning (Ahead of AI, Sebastian Raschka)
- Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation (arXiv 2507.10524)
- Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach (Geiping et al., arXiv 2502.05171)
- Universal Transformers (Dehghani et al., arXiv 1807.03819)