AI专业术语
OCR
Optical Character Recognition
光学字符识别 · 让机器看懂图片里的文字
多模态NLP
OCR
- 定义
- OCR(Optical Character Recognition)是AI领域的专业术语。OCR 将图片、扫描件、PDF 中的文字转换为可编辑的文本。
最后更新:2026-03-18
什么是OCR?
OCR 将图片、扫描件、PDF 中的文字转换为可编辑的文本。传统 OCR 已经很成熟,但 LLM 时代的多模态 OCR 能理解文档的布局和语义,不只是识别字符。
- 传统 OCR 识别字符,多模态 OCR 理解文档
- 中文 OCR 因字符复杂度高于英文更具挑战
- GPT-4V 等多模态模型正在重新定义 OCR
OCR详解
OCR 是最早商业化的 AI 技术之一,从 1990 年代的模板匹配发展到深度学习时代的端到端识别。当前 OCR 的前沿方向是文档理解:不仅识别文字,还理解表格、图表、公式等复杂布局的语义。GPT-4V 等多模态 LLM 的出现让 OCR 从「字符识别」升级为「文档理解」,能直接回答关于文档内容的问题。
OCR的应用场景
正式定义
从图像中自动识别和提取文字内容的计算机视觉技术
应用场景
- 文档数字化和归档
- 发票和票据的自动处理
- 多语言文本的图像翻译
常见误区
- 现代 OCR 不只是识别字符,还能理解文档结构
- OCR 准确率不是 100%,复杂排版和手写体仍有挑战
- 多模态 LLM 正在模糊 OCR 和文档理解的边界
实际案例
📌 多模态 OCR 的进化
传统 OCR 处理一张包含表格的文档需要先识别文字再解析表格结构,而 GPT-4V 可以直接「看懂」整个文档并回答问题,如「这张发票的总金额是多少」。
关于OCR的常见问题
- OCR 和多模态 LLM 识别文字有什么区别
- 传统 OCR 专注文字检测和识别,多模态 LLM 能同时理解图片内容和文字语义,但 OCR 在结构化提取上更精准。
- 中文 OCR 哪个工具好用
- 开源推荐 PaddleOCR,商用推荐百度/腾讯云 OCR API,复杂版面可结合多模态模型。