<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Document-Ai on Tony老师的博客</title><link>https://blog.tanteng.space/tags/document-ai/</link><description>Recent content in Document-Ai on Tony老师的博客</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Wed, 22 Jul 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.tanteng.space/tags/document-ai/index.xml" rel="self" type="application/rss+xml"/><item><title>多模态实战：VLM 文档理解与图片问答</title><link>https://blog.tanteng.space/2026/07/vlm-multimodal-practical/</link><pubDate>Wed, 22 Jul 2026 10:00:00 +0800</pubDate><guid>https://blog.tanteng.space/2026/07/vlm-multimodal-practical/</guid><description>&lt;blockquote&gt;
&lt;p&gt;2025 年 GPT-4o、Claude 4、Gemini 2.5 都原生支持多模态——能&amp;quot;看图&amp;quot;的 LLM 已经从前沿技术变成基础设施。但&lt;strong&gt;多模态 ≠ 万能&lt;/strong&gt;：图片理解有 4 个根本限制（幻觉、空间推理、计数、小文本）。这篇文章讲清楚 VLM 的真正能力和工程化路径。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;VLM（Vision-Language Model）让 LLM 突破&amp;quot;只能读文本&amp;quot;的边界——能看截图、读 PDF、理解图表、识别人脸、看懂 UI。这是 2025-2026 年 AI 应用最重要的能力扩展。&lt;/p&gt;
&lt;p&gt;但很多团队的 VLM 应用踩了同一个坑：&lt;strong&gt;直接拿来用，没考虑 VLM 的边界&lt;/strong&gt;。结果是上线后遇到各种边界 case 才补窟窿。&lt;/p&gt;</description></item></channel></rss>