<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>状态追踪 on Text Matrix</title><link>https://txtmix.com/tags/%E7%8A%B6%E6%80%81%E8%BF%BD%E8%B8%AA/</link><description>Recent content in 状态追踪 on Text Matrix</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 21 Jul 2026 20:06:14 +0800</lastBuildDate><atom:link href="https://txtmix.com/tags/%E7%8A%B6%E6%80%81%E8%BF%BD%E8%B8%AA/index.xml" rel="self" type="application/rss+xml"/><item><title>循环回来：DeepMind 一篇论文说 Transformer 的「思维链」是治标不治本</title><link>https://txtmix.com/posts/tech/deepmind-topological-trouble-with-transformers-cn/</link><pubDate>Thu, 18 Jun 2026 08:50:00 +0800</pubDate><guid>https://txtmix.com/posts/tech/deepmind-topological-trouble-with-transformers-cn/</guid><description>&lt;h2 id="学习目标">学习目标&lt;/h2>
&lt;p>读完本文后，你应能：&lt;/p>
&lt;ul>
&lt;li>解释 Transformer 的&amp;quot;拓扑缺陷&amp;quot;是什么，以及为什么状态表示 $s_t$ 必须比 $s_{t-1}$ 处于更深的层&lt;/li>
&lt;li>区分&amp;quot;工作记忆&amp;quot;策略与&amp;quot;状态追踪&amp;quot;策略，并说明为什么 Transformer 的&amp;quot;反复重读历史&amp;quot;不是真正的状态追踪&lt;/li>
&lt;li>说明 CoT（思维链）为什么只是补丁：它把深层状态&amp;quot;打印&amp;quot;成可见文字，但代价是算力、内存和概念层面的&lt;/li>
&lt;li>识别论文的二维分类法：循环轴（Depth/Step/Depth+Step）与每个循环步处理的 token 数（Ratio &amp;gt;1/=1/&amp;lt;1）&lt;/li>
&lt;li>判断哪类循环架构&amp;quot;治本&amp;quot;（步方向循环），哪类&amp;quot;治不了本&amp;quot;（深度方向循环）&lt;/li>
&lt;/ul>
&lt;h2 id="本文目录">本文目录&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="#%e4%b8%80transformer-%e4%b8%ba%e4%bb%80%e4%b9%88%e4%b8%8d%e6%93%85%e9%95%bf%e7%8a%b6%e6%80%81%e8%bf%bd%e8%b8%aa" rel="">一、Transformer 为什么不擅长&amp;quot;状态追踪&amp;quot;&lt;/a> - 拓扑缺陷的形式化分析&lt;/li>
&lt;li>&lt;a href="#%e4%ba%8c%e4%b8%ba%e4%bb%80%e4%b9%88%e8%af%b4%e8%bf%99%e6%98%af%e7%bc%ba%e9%99%b7%e8%80%8c%e4%b8%8d%e6%98%af%e7%89%b9%e6%80%a7" rel="">二、为什么说这是&amp;quot;缺陷&amp;quot;而不是&amp;quot;特性&amp;quot;&lt;/a> - 可构造性 vs 可学习性&lt;/li>
&lt;li>&lt;a href="#%e4%b8%89patchscopes%e6%8a%8a%e7%9c%8b%e4%b8%8d%e8%a7%81%e8%bf%99%e4%bb%b6%e4%ba%8b%e5%ae%9e%e8%af%81%e5%87%ba%e6%9d%a5" rel="">三、Patchscopes：把&amp;quot;看不见&amp;quot;这件事实证出来&lt;/a> - 猜数字游戏与 bank 歧义&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e5%9b%9bcot-%e6%98%af%e8%a1%a5%e4%b8%81%e4%bd%86%e8%a1%a5%e4%b8%81%e4%b9%9f%e6%98%af%e8%a1%a5%e4%b8%81" rel="">四、CoT 是补丁，但补丁也是补丁&lt;/a> - 思维链的原理与代价&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e4%ba%94%e5%be%aa%e7%8e%af%e6%9e%b6%e6%9e%84%e7%9a%84%e4%ba%8c%e7%bb%b4%e5%88%86%e7%b1%bb%e6%b3%95%e8%ae%ba%e6%96%87%e6%a0%b8%e5%bf%83%e8%b4%a1%e7%8c%ae" rel="">五、循环架构的二维分类法（论文核心贡献）&lt;/a> - 9 宫格分类法&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e5%85%ad%e4%b8%ba%e4%bb%80%e4%b9%88-transformer-%e8%bf%98%e8%bf%99%e4%b9%88%e8%83%bd%e6%89%93" rel="">六、为什么 Transformer 还这么能打&lt;/a> - 三个关键因素&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e4%b8%83%e6%9c%aa%e6%9d%a5-5-%e4%b8%aa%e6%96%b9%e5%90%91" rel="">七、未来 5 个方向&lt;/a> - 增强 SSM、近似状态追踪、粗粒度循环、表示对齐、高效训练&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e5%85%ab%e7%bb%93%e8%ae%ba%e4%bb%8e%e6%89%ab%e6%8f%8f%e5%8e%86%e5%8f%b2%e5%88%b0%e6%b5%81%e5%8a%a8%e7%9a%84%e8%ae%b0%e5%bf%86" rel="">八、结论：从&amp;quot;扫描历史&amp;quot;到&amp;quot;流动的记忆&amp;quot;&lt;/a> - 下一代基础模型的必经之路&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e8%87%aa%e6%b5%8b%e9%a2%98" rel="">自测题&lt;/a> - 检验理解程度&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e7%bb%83%e4%b9%a0" rel="">练习&lt;/a> - 动手实践&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e8%bf%9b%e9%98%b6%e8%b7%af%e5%be%84" rel="">进阶路径&lt;/a> - 从读者到研究者&amp;quot;&lt;/li>
&lt;li>&lt;a href="#%e5%b8%b8%e8%a7%81%e9%97%ae%e9%a2%98-faq" rel="">常见问题 FAQ&lt;/a> - 高频问题解答&amp;quot;&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h1 id="循环回来deepmind-一篇论文说-transformer-的思维链是治标不治本">循环回来：DeepMind 一篇论文说 Transformer 的「思维链」是治标不治本&lt;/h1>
&lt;p>如果让 Gemini 3 心里&amp;quot;想&amp;quot;一个 1 到 100 的数字，你猜 60，它说&amp;quot;更小&amp;quot;；你猜 41，它说&amp;quot;更小&amp;quot;；你猜 70，它说&amp;quot;更大&amp;quot;——三次回答自相矛盾，破绽立现。更耐人寻味的是，即便让模型进入&amp;quot;思考&amp;quot;模式，它也会在思考阶段清清楚楚写下&amp;quot;我选定的数字是 42，60 比 42 大，所以应该说 lower&amp;quot;，等到你真猜 42，它依然回答&amp;quot;lower&amp;quot;——刚刚的判断被自己忘得一干二净。&lt;/p></description></item></channel></rss>