← 글 모음

OCR for PDF

PDF 로 스캔한 책이 많이 있는데, OCR로 텍스트 인식은 되어 있지 않다. (600DPI 이미지형태)

그래서인지 용량이 꽤 크다, 1권당 몇 기가?

일단은 검색도 되게 하고, 용량도 절약할 겸 OCR을 한번 만들어본다.

처음에는, PaddleOCR을 써봤는데, 인식률이 그렇게 만족스럽지 않았다

좀 찾아보니, 최근 PaddleOCR-VL이라는것도 새로 나왔길래, 테스트 해 봤는데 꽤 괜찮다.

PaddleOCR - 文档解析与智能文字识别 | 支持API调用与MCP服务 - 飞桨星河社区

conda activate ocr310

아래는 샘플 페이지 및 인식 결과 (HTML로 output 생성)

마지막 수정