基于FPGA的OCR文字识别技术的深度解析_技术

OCR在通用文字识别等场景下有广泛应用，基于FPGA异构加速的OCR识别相比CPU/GPU实现具有延时小、成本低的优势。我们设计了多FPGA芯片协同的异构加速架构，能快速适配业务OCR模型变化，检测识别整体性能为GPU P4 130%，处理延时仅为P4的1/10，CPU的1/30。

1.文字识别技术- OCR

OCR技术，通俗来讲就是从图像中检测并识别字符的一种方法，在证通用文字识别、书籍电子化、自动信息采集、证照类识别等应用场景中得到了广泛应用。通用场景的OCR因此通用场景下的OCR技术一直都是人工智能领域挑战性极强的研究领域，不需要针对特殊场景进行定制，可以识别任意场景图片中的文字。

通用OCR技术包含两大关键技术：文本检测和文字识别。检测模型的作用简单来说就是确定图片中哪里有字，并把有字的区域框出来。文字识别是将文本检测box作为输入，识别出其中的字符。

近年来深度学习逐渐被应用到音频、视频以及自然语言理解等时序数据建模的领域。通过深度学习的端到端学习提升Sequence Learning的效果已经成为当前研究的热点。基本思路是CNN与RNN结合：CNN被用于提取有表征能力的图像特征，将RNN的序列化特性引入到文本检测，增加了文本检测候选区域的上下文信息，可以有效地提升文本检测任务的性能。CNN+RNN的混合网络将文本串识别领域的效果推到了一个新的高度。