<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>视觉几何 on Text Matrix</title><link>https://txtmix.com/tags/%E8%A7%86%E8%A7%89%E5%87%A0%E4%BD%95/</link><description>Recent content in 视觉几何 on Text Matrix</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 21 Jul 2026 20:06:14 +0800</lastBuildDate><atom:link href="https://txtmix.com/tags/%E8%A7%86%E8%A7%89%E5%87%A0%E4%BD%95/index.xml" rel="self" type="application/rss+xml"/><item><title>LingBot-Map：流式3D重建的几何上下文Transformer</title><link>https://txtmix.com/posts/tech/robbyant-lingbot-map-ai-world-model-guide/</link><pubDate>Sun, 28 Jun 2026 21:06:29 +0800</pubDate><guid>https://txtmix.com/posts/tech/robbyant-lingbot-map-ai-world-model-guide/</guid><description>&lt;h2 id="学习目标">学习目标&lt;/h2>
&lt;p>阅读本文后，你将能够：&lt;/p>
&lt;ol>
&lt;li>解释 LingBot-Map 的核心判断——它把 3D 重建从&amp;quot;迭代优化&amp;quot;推向&amp;quot;流式前馈&amp;quot;——以及这个转向背后的架构动机。&lt;/li>
&lt;li>描述 LingBot-Map 的三件套（anchor context、pose-reference window、trajectory memory）各自解决什么问题，以及它们如何嵌套工作。&lt;/li>
&lt;li>理解分页 KV 缓存 + FlashInfer 的工程实现，以及为什么这是长视频重建的关键。&lt;/li>
&lt;li>独立完成 LingBot-Map 的环境配置、模型下载和 &lt;code>demo.py&lt;/code> 交互式预览，并判断你的视频是否适合用 LingBot-Map 重建。&lt;/li>
&lt;li>列出 LingBot-Map 的适用边界（适合/不适合的场景），并使用官方推荐的采用顺序评估是否要在你的项目中落地。&lt;/li>
&lt;/ol>
&lt;h2 id="目录">目录&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="#%e5%ad%a6%e4%b9%a0%e7%9b%ae%e6%a0%87" rel="">学习目标&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e6%a0%b8%e5%bf%83%e5%88%a4%e6%96%ad" rel="">核心判断&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e7%b3%bb%e7%bb%9f%e5%9c%b0%e5%9b%be" rel="">系统地图&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%be%b9%e7%95%8c%e6%8b%86%e5%88%86%e6%b5%81%e5%bc%8f%e5%89%8d%e9%a6%88-vs-%e8%bf%ad%e4%bb%a3%e4%bc%98%e5%8c%96" rel="">边界拆分：流式前馈 vs 迭代优化&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e5%85%b3%e9%94%ae%e6%9c%ba%e5%88%b6%e6%8a%8a%e6%b5%81%e5%bc%8f%e8%b7%91%e9%80%9a%e7%9a%84%e4%b8%89%e5%9d%97%e6%8b%bc%e5%9b%be" rel="">关键机制：把流式跑通的三块拼图&lt;/a>
&lt;ul>
&lt;li>&lt;a href="#1-%e5%88%86%e9%a1%b5-kv-%e7%bc%93%e5%ad%98--flashinfer" rel="">1. 分页 KV 缓存 + FlashInfer&lt;/a>&lt;/li>
&lt;li>&lt;a href="#2-%e5%85%b3%e9%94%ae%e5%b8%a7%e9%97%b4%e9%9a%94keyframe-interval" rel="">2. 关键帧间隔（keyframe interval）&lt;/a>&lt;/li>
&lt;li>&lt;a href="#3-%e7%aa%97%e5%8f%a3%e6%8e%a8%e7%90%86windowed-mode" rel="">3. 窗口推理（windowed mode）&lt;/a>&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;a href="#%e4%bb%bb%e5%8a%a1%e6%b5%81%e6%a1%88%e4%be%8btravel-%e5%ba%8f%e5%88%97%e7%ab%af%e5%88%b0%e7%ab%af" rel="">任务流案例：travel 序列端到端&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%af%84%e4%bc%b0%e4%b8%8e%e8%be%b9%e7%95%8c" rel="">评估与边界&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e9%80%82%e7%94%a8%e8%be%b9%e7%95%8c%e4%b8%8e%e9%87%87%e7%94%a8%e9%a1%ba%e5%ba%8f" rel="">适用边界与采用顺序&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e7%bb%83%e4%b9%a0" rel="">练习&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%87%aa%e6%b5%8b" rel="">自测&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%bf%9b%e9%98%b6%e8%b7%af%e5%be%84" rel="">进阶路径&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e5%b8%b8%e8%a7%81%e9%97%ae%e9%a2%98-faq" rel="">常见问题 FAQ&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e5%bb%b6%e4%bc%b8%e9%98%85%e8%af%bb" rel="">延伸阅读&lt;/a>&lt;/li>
&lt;/ul>
&lt;h2 id="核心判断">核心判断&lt;/h2>
&lt;p>LingBot-Map 把 3D 重建从「迭代优化」推向「流式前馈」：单次前向就能在长视频流上稳定输出相机位姿与稠密几何，配合分页 KV 缓存（FlashInfer 实现）实现约 20 FPS / 518×378 分辨率的推理，超过 10 000 帧的序列也能保持稳定。它的关键不是又一个 NeRF 或 Gaussian Splatting 变体，而是一套面向流式场景的几何上下文架构——anchor context、pose-reference window、trajectory memory 三件套，把「定位-几何-长程一致性」三类原本分裂的问题压进同一个 Transformer。&lt;/p></description></item></channel></rss>