LELexEdge词汇锋面
AI专业术语

OCR

Optical Character Recognition

光学字符识别 · 让机器看懂图片里的文字

多模态NLP
OCR
定义
OCROptical Character RecognitionAI领域的专业术语OCR 将图片、扫描件、PDF 中的文字转换为可编辑的文本。

最后更新:2026-03-18

什么是OCR?

OCR 将图片、扫描件、PDF 中的文字转换为可编辑的文本。传统 OCR 已经很成熟,但 LLM 时代的多模态 OCR 能理解文档的布局和语义,不只是识别字符。

  • 传统 OCR 识别字符,多模态 OCR 理解文档
  • 中文 OCR 因字符复杂度高于英文更具挑战
  • GPT-4V 等多模态模型正在重新定义 OCR

OCR详解

OCR 是最早商业化的 AI 技术之一,从 1990 年代的模板匹配发展到深度学习时代的端到端识别。当前 OCR 的前沿方向是文档理解:不仅识别文字,还理解表格、图表、公式等复杂布局的语义。GPT-4V 等多模态 LLM 的出现让 OCR 从「字符识别」升级为「文档理解」,能直接回答关于文档内容的问题。

OCR的应用场景

正式定义

从图像中自动识别和提取文字内容的计算机视觉技术

应用场景

  • 文档数字化和归档
  • 发票和票据的自动处理
  • 多语言文本的图像翻译

常见误区

  • 现代 OCR 不只是识别字符,还能理解文档结构
  • OCR 准确率不是 100%,复杂排版和手写体仍有挑战
  • 多模态 LLM 正在模糊 OCR 和文档理解的边界

实际案例

📌 多模态 OCR 的进化

传统 OCR 处理一张包含表格的文档需要先识别文字再解析表格结构,而 GPT-4V 可以直接「看懂」整个文档并回答问题,如「这张发票的总金额是多少」。

关于OCR的常见问题

OCR 和多模态 LLM 识别文字有什么区别
传统 OCR 专注文字检测和识别,多模态 LLM 能同时理解图片内容和文字语义,但 OCR 在结构化提取上更精准。
中文 OCR 哪个工具好用
开源推荐 PaddleOCR,商用推荐百度/腾讯云 OCR API,复杂版面可结合多模态模型。