OCR의 발전: 문자 인식에서 구조화된 데이터까지
OCR은 이미지 속 글자를 컴퓨터가 읽을 수 있는 텍스트로 변환합니다. 2026년 1월의 이 해설에서는 OCR과 필드·표 추출의 관계, 그리고 멀티모달 언어 모델이 가져온 변화를 살펴봅니다.
편집 업데이트 . 발표 당시의 맥락을 유지하면서 내용을 더 명확하게 다듬었습니다.
문자 인식
기존 OCR 처리 과정은 이미지를 전처리하고, 텍스트 위치를 찾고, 문자를 인식한 뒤 위치나 레이아웃 정보와 함께 텍스트를 반환할 수 있습니다. 도구마다 기능이 다르며 OCR이 구조 없는 텍스트 출력에만 한정되는 것은 아닙니다. 특정 업무 필드를 추출하려면 규칙이나 추가 처리 단계가 필요한 경우가 많습니다.
멀티모달 모델을 통한 추출
GPT-4 Vision, Claude 등의 모델은 이미지 입력과 언어 지시를 하나의 작업 과정으로 통합했습니다. 청구서 필드를 식별하거나 세부 항목을 정리하도록 요청할 수 있게 된 것입니다. 문맥이 도움이 될 수 있지만, 추론한 값은 원본에 실제로 보이는 텍스트와 다릅니다.
접근 방식 비교
선택은 문서의 특성, 필요한 출력, 결과 확인 방식에 따라 달라집니다. 어느 방식도 손글씨, 손상된 스캔, 익숙하지 않은 레이아웃에서 정확한 추출을 보장하지는 않습니다.
| 비교 항목 | 기존 OCR | 멀티모달 추출 |
|---|---|---|
| 출력 | 텍스트 및 도구에 따라 제공되는 레이아웃 정보 | 지시를 통해 요청한 필드 또는 구조화된 출력 |
| 준비 작업 | 전처리와 필드별 파싱이 필요할 수 있음 | 지시, 스키마, 출력 검증이 필요할 수 있음 |
| 오류 | 인식 및 레이아웃 오류 확인 필요 | 인식 오류와 추론된 값 확인 필요 |
금융 문서 이외의 활용
원래 글에서는 의료 기록, 법률 문서, 물류, 접근성, 기록 보관, 차량 관련 문자 인식을 소개했습니다. 이는 OCR의 활용 예시이며 ScanToExcel 제품 기능 목록이 아닙니다.
중요한 이유
수동 입력을 줄이면 데이터를 확인하고 활용하는 데 더 많은 시간을 쓸 수 있습니다. 실제 이점은 결과 품질과 검토에 드는 노력에 따라 달라지며, 자동 추출을 하더라도 검토 단계는 필요합니다.