中文扫描件识别需要更大的模型和语言包,简体中文(chi_sim)与英文混排是最常见的场景。
In practice: (1) 中英混排文档选择组合语言包,准确率明显更高。 (2) 竖排繁体文档建议单独用繁体语言包。 (3) 先纠偏/裁边再识别效果更好。
Frequently asked questions
能识别手写中文吗?
印刷体识别可靠;手写体准确率有限,重要内容请人工复核。
会不会改变 PDF 外观?
不会。识别结果作为隐形文字层叠加在页面图像上。
Do it in the full tool
Open OCR PDF for all options, or jump straight to another step below.