<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VLM on Tony老师的博客</title><link>https://blog.tanteng.space/tags/vlm/</link><description>Recent content in VLM on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Wed, 22 Jul 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/vlm/index.xml" rel="self" type="application/rss+xml"/><item><title>多模态实战：VLM 文档理解与图片问答</title><link>https://blog.tanteng.space/2026/07/vlm-multimodal-practical/</link><pubDate>Wed, 22 Jul 2026 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2026/07/vlm-multimodal-practical/</guid><description>&lt;blockquote&gt;
&lt;p&gt;2025 年 GPT-4o、Claude 4、Gemini 2.5 都原生支持多模态——能&amp;quot;看图&amp;quot;的 LLM 已经从前沿技术变成基础设施。但&lt;strong&gt;多模态 ≠ 万能&lt;/strong&gt;：图片理解有 4 个根本限制（幻觉、空间推理、计数、小文本）。这篇文章讲清楚 VLM 的真正能力和工程化路径。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;VLM（Vision-Language Model）让 LLM 突破&amp;quot;只能读文本&amp;quot;的边界——能看截图、读 PDF、理解图表、识别人脸、看懂 UI。这是 2025-2026 年 AI 应用最重要的能力扩展。&lt;/p&gt;
&lt;p&gt;但很多团队的 VLM 应用踩了同一个坑：&lt;strong&gt;直接拿来用，没考虑 VLM 的边界&lt;/strong&gt;。结果是上线后遇到各种边界 case 才补窟窿。&lt;/p&gt;</description></item><item><title>多模态 RAG：ColPali 让 VLM 直接读 PDF</title><link>https://blog.tanteng.space/2025/07/multimodal-rag-and-colpali/</link><pubDate>Tue, 08 Jul 2025 15:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2025/07/multimodal-rag-and-colpali/</guid><description>&lt;blockquote&gt;
&lt;p&gt;2023 年我们做合同 RAG，要先 OCR 提取文本，再做 layout 分析识别表格，再用 PyMuPDF 切 chunk，最后 embedding 入库。整条管线 6 个组件，每个都可能丢信息——表格合并了、数字 OCR 错了、扫描件直接卡死。&lt;strong&gt;到 2024 年 ColPali 出现，这条管线被彻底推翻&lt;/strong&gt;：把 PDF 当图片扔给 VLM，模型同时理解文字、表格、图表、手写体，&lt;strong&gt;直接出 patch embedding&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这是一篇多模态 RAG 检索架构的文章。Phase 1-6 的 RAG 文章讲了&amp;quot;召回率优化&amp;quot;（BM25 + 向量 + rerank），本文讲的是&lt;strong&gt;当文档本身就是图像时&lt;/strong&gt;的范式跃迁：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;传统 OCR + chunking 管线的 4 个失效场景&lt;/li&gt;
&lt;li&gt;ColPali 的核心思路：&lt;strong&gt;PDF → 图片 → VLM → patch embedding → 检索&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;Late Interaction（ColBERT 风格）在视觉空间的延伸&lt;/li&gt;
&lt;li&gt;ColQwen2/2.5、ViDoRe benchmark、工程取舍&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>