본문으로 건너뛰기

3분만에 간편하게, 우리 회사 맞춤 솔루션
무료 추천받기

Q. 가장 개선하고 싶은 목표는 무엇인가요?

임팩트플로우는 추천부터 도입 완료까지 모든 과정을 도입의무 없는 무료 서비스로 제공합니다.

DB하이텍
(주)스포티비
현대산업
한국잡월드파트너즈
서초구가족센터
대아티아이 주식회사
젠틀에너지 주식회사
플라스틱비치 주식회사
musicow
매일헬스뉴트리션
와이비엠
(주)티센바이오팜
CUPIA
KS신용정보
hdc resort
HL 만도
saltlux
농심기획
와이즐리
글로우서울
크린토피아
팜에이트
포항공과대학교
대한항공
(주)이미인
(주)YG엔터테인먼트
(주)에스오넷
(주)대성하이테크
메리티움(주)
민주화운동기념사업회
프라임코리아엑퀴지션유한회사
Group KFF
소맥베이커리
엔에프씨
(주)헤이스택코퍼레이션
커피수공업
커피수공업
(주)진한식품
DB하이텍
(주)스포티비
현대산업
한국잡월드파트너즈
서초구가족센터
대아티아이 주식회사
젠틀에너지 주식회사
플라스틱비치 주식회사
musicow
매일헬스뉴트리션
와이비엠
(주)티센바이오팜
CUPIA
KS신용정보
hdc resort
HL 만도
saltlux
농심기획
와이즐리
글로우서울
크린토피아
팜에이트
포항공과대학교
대한항공
(주)이미인
(주)YG엔터테인먼트
(주)에스오넷
(주)대성하이테크
메리티움(주)
민주화운동기념사업회
프라임코리아엑퀴지션유한회사
Group KFF
소맥베이커리
엔에프씨
(주)헤이스택코퍼레이션
커피수공업
커피수공업
(주)진한식품

OCR 프로그램은 이미지나 PDF 속 글자를 편집·검색할 수 있는 데이터로 바꾸는 도구입니다. 무료 도구로 충분한지는 읽힐 문서가 정해진 양식인지, 오인식을 누가 걸러내는지, 월 몇 장인지, 결과가 어느 시스템으로 가야 하는지, 문서를 외부로 내보낼 수 있는지 다섯 가지가 가릅니다.

OCR 프로그램이 실제로 하는 일 — 읽는 것과 넘기는 것은 다른 단계다

OCR(광학 문자 인식)은 이미지나 스캔본 속 글자를 사람이 다시 타이핑하지 않아도 되는 데이터로 바꾸는 기술입니다. 다만 업무에서 OCR을 찾는 이유는 글자를 읽기 위해서가 아니라 손으로 옮겨 적는 일을 없애기 위해서입니다. 그래서 도구를 고를 때는 인식 정확도 하나가 아니라, 읽은 뒤에 무엇까지 해 주는지를 함께 봐야 합니다.

업무에서 OCR이 지나가는 길은 세 단계로 나뉩니다.

  • 인식 — 이미지 속 글자 모양을 문자로 바꾸는 단계입니다. 결과물은 줄글 텍스트입니다.
  • 구조화 — 읽어 낸 텍스트 중 어떤 값이 공급자 상호이고 어떤 값이 공급가액·거래일자인지 항목에 배정하는 단계입니다. 표 형태의 행과 열을 유지하는 것도 여기에 해당합니다.
  • 전달 — 배정된 값을 회계 프로그램의 전표나 전자결재 양식, 문서 보관 시스템으로 넘기는 단계입니다.

개인용으로 쓰이는 무료 도구 다수는 첫 번째 단계에서 끝납니다. 화면에 텍스트가 나오면 사용자가 복사해 붙여 넣는 방식이라, 한 장을 빠르게 옮길 때는 충분하지만 매달 수백 장의 청구서를 처리하는 자리에서는 옮겨 적는 노동이 그대로 남습니다. 텍스트가 나왔는데도 업무 시간이 줄지 않는다면 대개 두 번째와 세 번째 단계가 비어 있는 경우입니다.

아래 다섯 가지 기준은 이 세 단계 중 어디까지가 필요한지를 우리 회사 조건에 대입해 보는 질문입니다.

기준 1. 읽히려는 문서가 정해진 양식인가, 자유 문서인가

가장 먼저 가려야 할 것은 처리할 문서의 성격입니다. 문서는 크게 두 종류로 나뉩니다.

OCR 프로그램 선택을 가르는 5가지 기준

정형 문서는 항목의 위치와 이름이 대체로 정해져 있는 서류입니다. 세금계산서·영수증·신분증·통장 사본·급여대장처럼 어디에 금액이 있고 어디에 상호가 있는지 예측할 수 있습니다. 이 경우에는 항목 단위로 값을 뽑아내는 기능이 잘 맞고, 같은 양식이 반복되므로 자동화 효과도 큽니다.

비정형 문서는 작성자마다 형식이 달라지는 서류입니다. 계약서·공문·제안서·거래처마다 다른 명세서가 여기에 해당합니다. 항목 위치가 고정돼 있지 않으므로 값을 정확히 뽑으려면 양식별 학습이나 규칙 설정이 필요하고, 그 설정 작업을 누가 하는지가 도입 비용을 좌우합니다.

그래서 확인할 질문은 다음과 같습니다.

  • 처리할 문서 종류가 몇 가지이고, 그중 양식이 고정된 것은 몇 가지인가
  • 사진으로 찍은 종이 문서인가, 스캐너로 만든 PDF인가, 처음부터 전자문서로 받은 파일인가 — 원본 품질에 따라 인식 결과가 달라집니다
  • 손글씨가 섞여 있는가 — 수기 메모·서명·도장은 활자와 다른 처리 방식이 필요합니다
  • 표가 포함돼 있는가 — 표의 행과 열을 유지한 채로 뽑아야 하는지, 줄글로 나와도 되는지에 따라 필요한 기능이 갈립니다
  • 영문·중문 서류나 해외 거래처 인보이스를 함께 읽혀야 하는가 — 언어별 인식 수준과 현지 양식 대응 여부를 확인 대상으로 둡니다

문서 종류가 한두 가지로 정해져 있고 양식도 고정돼 있다면 선택지가 넓습니다. 반대로 거래처마다 다른 서류를 매일 받는 구조라면 뒤에 나올 기준 2와 기준 4의 비중이 커집니다.

기준 2. 오인식을 누가 걸러내는가 — 틀린 글자가 남는 자리

어떤 방식이든 인식 결과는 일반적으로 100%가 되지 않습니다. 숫자 1과 7, 0과 알파벳 O, 도장이나 접힌 자국에 겹친 글자, 흐릿하게 복사된 부분에서 오차가 생깁니다. 그래서 실무에서 갈리는 지점은 인식률 수치 자체가 아니라 틀린 값을 발견하는 절차가 업무 흐름 안에 있는가입니다.

금액이 한 자리 잘못 들어간 전표는 마감 때 대사 과정에서 찾아내야 하고, 그때 드는 시간이 옮겨 적는 시간보다 길어지면 도입 효과가 사라집니다. 확인할 항목은 다음과 같습니다.

  • 원본 이미지와 추출값을 나란히 놓고 검토하는 화면이 있는가 — 없으면 결국 원본 파일을 따로 열어 대조하게 됩니다
  • 값마다 인식 신뢰도를 표시해 확인이 필요한 항목만 골라 주는가 — 전수 검토와 선별 검토는 소요 시간이 크게 다릅니다
  • 합계와 항목 금액이 맞는지, 사업자등록번호 형식이 맞는지 같은 자동 검산 규칙을 걸 수 있는가
  • 검토 담당자와 최종 승인자를 나눌 수 있는가 — 입력한 사람이 스스로 검수하면 같은 실수가 그대로 통과합니다
  • 수정한 값이 다음 인식에 반영되는가 — 같은 거래처 서류에서 같은 오류가 반복되는지를 가르는 지점입니다

월 처리량이 적고 담당자가 어차피 전건을 눈으로 보는 상황이라면 이 기능들이 없어도 무방합니다. 검토 자체를 줄이고 싶은 단계에 와 있다면 이 항목이 사실상 선택의 중심이 됩니다.

기준 3. 한 달에 몇 장을 처리하는가 — 건수가 넘어가면 방식이 바뀐다

처리량은 기능 요구뿐 아니라 비용 구조 자체를 바꿉니다. 한 달에 몇 장을, 어느 시기에 몰아서 처리하는지 먼저 세어 보는 편이 좋습니다. 월말·월초에 몰리는 마감 업무라면 평균값보다 피크 물량이 기준이 됩니다.

처리량이 늘어날 때 실제로 걸리는 지점은 인식 자체보다 앞뒤 작업입니다. 파일을 한 장씩 올려야 하는 구조라면 200장을 올리는 데만 반나절 수준이 드는 것으로 추정되고, 결과를 한 건씩 복사해야 한다면 그 시간이 다시 붙습니다. 그래서 다음을 확인합니다.

  • 여러 파일을 한 번에 올리고 한 번에 내려받을 수 있는가
  • 스캐너·복합기에서 지정 폴더로 저장하면 자동으로 읽히는가, 메일로 받은 첨부파일을 자동 수집할 수 있는가
  • 동시에 여러 명이 나눠 처리하고 진행 상태를 함께 볼 수 있는가
  • 무료 또는 기본 요금제의 처리 한도가 월 단위인지 일 단위인지, 한도를 넘었을 때 어떻게 되는지
  • 보관 기간이 정해져 있는가 — 처리한 원본과 결과가 일정 기간 뒤 삭제되는 조건이라면 별도 보관 방법이 필요합니다

무료로 되는 구간과 업무용으로 넘어가는 구간을 가르는 방식은 다른 문서 업무에서도 비슷하게 나타납니다. 같은 구조를 전자서명 쪽에서 정리한 내용은 전자서명 무료 방법과 무료의 한계에서 확인할 수 있습니다.

기준 4. 뽑아낸 값이 어디로 들어가야 일이 끝나는가

이 기준이 개인용과 업무용을 가장 분명하게 가릅니다. 텍스트가 화면에 나오는 것으로 끝나는 업무는 드물고, 대부분은 그 값이 다른 시스템에 들어가야 일이 마무리됩니다. 청구서에서 읽어 낸 금액과 거래처는 지출결의나 품의로 이어져야 하고, 영수증 정보는 회계 전표가 되어야 하며, 입사 서류에서 뽑은 인적 사항은 인사 기록에 들어가야 합니다.

OCR이 지나가는 세 단계 — 인식·구조화·전달

도착지를 먼저 정하면 필요한 연동 방식이 따라 나옵니다.

  • 엑셀·CSV 파일로 내려받아 사람이 업로드하는 방식으로 충분한가
  • 회계·ERP·전자결재 시스템과 직접 연결되는가 — 파일 내보내기까지인지, API로 전표나 결재 문서까지 생성되는지에 따라 남는 수작업이 달라집니다
  • 추출값과 함께 원본 이미지가 증빙으로 붙어 보관되는가 — 나중에 확인할 때 원본을 다시 찾아야 하면 작업이 한 번 더 생깁니다
  • 법인이나 사업장이 여러 개라면 결과를 단위별로 분리해 볼 수 있는가 — 규모가 커질수록 이 구분이 실제 병목이 됩니다
  • 처리 이력이 남는가 — 누가 언제 어떤 값을 수정했는지 추적할 수 있어야 감사 대응이 가능합니다

추출한 금액과 거래처가 결재 문서로 이어지는 구조를 만들려면 결재 쪽 양식과 승인 단계를 함께 봐야 합니다. 결재 시스템을 고르는 축은 전자결재 시스템 선택 기준에 정리돼 있습니다. 한편 읽어 들인 문서를 어디에 쌓고 어떻게 다시 찾을지는 입력이 아니라 보관·조회 영역의 문제입니다. 이 구분은 문서관리 솔루션 비교에서 다루는 내용과 이어집니다. OCR은 종이를 데이터로 만드는 입구이고, 문서관리는 그 데이터를 쌓아 두고 꺼내는 창고에 해당합니다.

기준 5. 그 문서를 외부로 내보낼 수 있는가 — 처리 위치와 개인정보

마지막 기준은 기능이 아니라 조건입니다. 온라인 변환 사이트나 클라우드 서비스에 파일을 올리는 순간 그 문서는 외부 서버에서 처리됩니다. 신분증 사본·급여대장·계약서·건강검진 결과처럼 개인정보나 민감정보가 담긴 서류라면 올리기 전에 검토가 필요합니다.

외부 서비스에 개인정보 처리를 맡기는 것은 법적으로 업무 위탁에 해당합니다. 개인정보 보호법 제26조는 위탁 시 문서에 담아야 할 사항과 위탁 사실의 공개 의무를 정하고 있고, 처리 서버가 국외에 있는 경우에는 제28조의8의 국외 이전 요건이 함께 적용됩니다(개인정보 보호법 제26조·제28조의8). 개인 사용자가 무료 사이트에 한 장을 올릴 때는 문제가 되지 않던 일이, 회사가 직원과 거래처의 서류를 반복해 올리는 순간 성격이 달라지는 이유가 여기에 있습니다.

확인 순서는 다음과 같습니다.

  • 처리할 문서에 개인정보·민감정보가 포함되는가 — 포함된다면 아래 항목을 모두 확인합니다
  • 처리가 어디에서 이뤄지는가 — 사내 서버 설치형인지, 국내 클라우드인지, 국외 서버인지
  • 업로드한 원본과 처리 결과가 언제 삭제되는가, 학습 데이터로 사용되지 않는다는 조건이 약관에 있는가
  • 위탁 계약서와 개인정보 처리방침의 위탁 현황을 갱신할 수 있는 구조인가
  • 사내 보안 정책이나 업종 규정이 외부 반출 자체를 제한하고 있지는 않은가 — 금융·의료 분야는 별도 기준이 적용될 수 있습니다

반출이 어려운 문서가 섞여 있다면 도구 선택지가 크게 좁아지므로, 이 기준은 비교를 시작하기 전에 먼저 확인하는 편이 시간을 아낍니다.

유형별로 충족·미충족이 갈리는 지점과 비용이 결정되는 축

시중에서 OCR을 제공하는 방식은 크게 네 범주로 묶입니다. 개별 제품 이름보다 범주별 성격을 먼저 파악하면 앞의 다섯 가지 기준에 대입하기 쉽습니다.

  • 문서 편집기 내장 기능 — PDF 편집 프로그램이나 사무용 소프트웨어에 포함된 문자 인식 기능입니다. 이미 쓰는 도구 안에서 바로 쓸 수 있습니다.
  • 온라인 변환 사이트 — 웹 페이지에 파일을 올리면 변환 결과를 내려받는 방식입니다. 설치가 필요 없고 즉시 쓸 수 있습니다.
  • 클라우드 AI OCR API — 개발 연동을 전제로 인식·추출 기능만 제공하는 방식입니다. 우리 시스템에 붙이는 작업은 직접 하거나 별도로 맡겨야 합니다.
  • 업무 문서 자동화 서비스 — 특정 서류 유형(청구서·영수증·계약서 등)을 전제로 인식부터 검증·전달까지 한 흐름으로 묶어 제공하는 방식입니다.
구분 기준 1
양식 대응
기준 2
검증 절차
기준 3
대량 처리
기준 4
시스템 전달
기준 5
처리 위치 선택
문서 편집기 내장 기능 텍스트 변환 위주 사람이 전수 확인 한 건씩 복사·붙여넣기 사내 처리 가능
온라인 변환 사이트 텍스트 변환 위주 사람이 전수 확인 한도 내 일괄 파일 내려받기 외부 서버 고정
클라우드 AI OCR API 항목 추출 가능 직접 구현 대량 가능 연동 개발 필요 사업자별 상이
업무 문서 자동화 서비스 서류 유형별 대응 검토 화면 제공 대량 가능 연동 범위 확인 설치형 여부 확인

표의 값은 범주별 일반적인 성격이며, 같은 범주 안에서도 서비스마다 제공 범위가 다릅니다. 후보를 좁힌 뒤에는 위 다섯 칸을 각 서비스 자료로 다시 채워 확인하는 편이 정확합니다.

비용은 금액을 나란히 놓기 전에 무엇에 따라 움직이는지를 먼저 봐야 비교가 성립합니다. OCR에서 총비용을 구성하는 축은 대체로 다음 네 가지입니다.

  • 처리량 단위 — 페이지 수나 건수에 따라 늘어나는 부분입니다. 월 처리량의 피크 기준으로 계산해야 실제 비용에 가깝습니다.
  • 사용자 단위 — 쓰는 사람 수에 따라 늘어나는 부분입니다. 검토자까지 계정이 필요한지 확인합니다.
  • 양식 학습·구축 — 비정형 문서나 회사 고유 양식을 인식시키기 위한 초기 설정 작업입니다. 양식 수에 비례하고, 대개 한 번 발생합니다.
  • 연동 개발 — 회계·결재 시스템에 값을 넘기기 위한 작업입니다. 기존 시스템이 제공하는 연결 방식에 따라 범위가 달라집니다.

여기에 사람이 검토하는 시간이 얼마나 남는지를 함께 놓아야 도입 전후를 비교할 수 있습니다. 계약 단위가 건수든 사용자 수든, 우리 월 처리량과 검토 시간을 같은 조건으로 제시해야 서비스 간 비교가 어긋나지 않습니다.

도입 전에 우리 쪽에서 먼저 정리해 두면 비교가 빨라지는 항목은 세 가지입니다.

  • 읽힐 문서의 종류와 각각의 양식 고정 여부 — 종류별로 한 장씩 샘플을 모아 두면 인식 테스트를 바로 요청할 수 있습니다
  • 월 처리 건수와 몰리는 시기 — 평균이 아니라 가장 많은 달을 기준으로 적습니다
  • 추출값이 최종적으로 들어가야 할 시스템 이름과 연결 방식 — 파일 업로드까지인지, 자동 반영까지인지 적어 둡니다

임팩트플로우는 B2B SaaS 매칭 플랫폼으로, 기업에 최적화된 OCR·데이터 추출 솔루션을 연결합니다. 국내에서 제공되는 서비스의 종류와 기능 범위는 OCR·데이터 추출 솔루션 리스트에서 확인할 수 있습니다. 무엇부터 자동화할지 순서를 정하는 과정은 OCR이 아닌 인사 업무 사례이지만 업무 자동화 도입 순서를 정한 사례에서 참고할 수 있습니다.

자주 묻는 질문

Q1. 무료 OCR 프로그램으로 회사 업무를 처리해도 되나요?

처리할 수 있는 조건이 정해져 있습니다. 월 처리량이 담당자가 눈으로 전수 확인할 수 있는 수준이고, 결과를 사람이 직접 옮겨 넣어도 부담이 없으며, 문서에 개인정보가 없다면 무료 도구로 충분합니다. 반대로 개인정보가 담긴 서류를 외부 사이트에 올려야 하거나, 처리량이 늘어 검토 시간이 입력 시간만큼 커졌거나, 값이 회계·결재 시스템에 자동으로 들어가야 한다면 조건을 넘어선 상태입니다. 무료 서비스는 약관에서 업무 용도 사용 허용 여부와 업로드 파일의 보관·삭제 조건을 함께 확인해야 합니다.

Q2. OCR 인식률이 100%가 될 수 있나요?

되지 않는다고 보고 업무를 설계하는 편이 안전합니다. 인식 결과는 원본 품질·글꼴·손글씨 여부·도장이나 접힌 자국의 간섭에 따라 달라지고, 같은 서비스라도 문서에 따라 결과가 갈립니다. 그래서 실무에서 판단 기준이 되는 것은 인식률 수치보다 틀린 값을 언제 어떻게 발견하는가입니다. 원본과 추출값을 나란히 보는 화면, 값별 신뢰도 표시, 합계·번호 형식 검산 규칙이 있으면 확인해야 할 항목만 골라낼 수 있습니다. 도입을 검토할 때는 우리가 실제로 쓰는 서류 샘플로 시험해 보고, 오차가 났을 때 수정에 걸리는 시간을 함께 재 보는 방법이 있습니다.

Q3. 스캔한 PDF의 표를 엑셀로 그대로 옮길 수 있나요?

기능에 따라 갈립니다. 텍스트 변환만 하는 도구는 표를 줄글로 풀어 내보내는 경우가 많아 행과 열을 사람이 다시 맞춰야 합니다. 표 구조를 인식하는 기능이 있으면 셀 단위로 값이 유지된 상태로 내보낼 수 있습니다. 병합된 셀, 여러 쪽에 걸친 표, 항목 이름이 줄바꿈된 표에서는 결과가 어긋나기 쉬우므로 실제 사용하는 양식으로 확인하는 과정이 필요합니다. 항목 이름이 매번 같은 정형 서류라면 표 인식보다 항목 추출 방식이 결과가 안정적입니다.

Q4. 개인정보가 담긴 서류를 온라인 OCR 사이트에 올려도 되나요?

회사가 업무로 처리하는 경우에는 그대로 올리기 전에 확인이 필요합니다. 외부 서비스에 개인정보 처리를 맡기는 것은 업무 위탁에 해당해 위탁 문서 작성과 위탁 사실 공개 의무가 따르고, 처리 서버가 국외에 있다면 국외 이전 요건이 추가로 적용됩니다(개인정보 보호법 제26조·제28조의8). 실무에서는 서비스 약관의 데이터 보관·삭제 조건과 학습 데이터 사용 여부, 처리 서버 위치를 먼저 확인하고, 사내 보안 정책이 외부 반출을 제한하는지 함께 점검합니다. 반출이 어려운 문서가 있다면 사내 설치형이나 국내 처리 조건을 제공하는 방식으로 후보를 좁히게 됩니다.


OCR 프로그램의 선택은 인식 성능 비교가 아니라 우리 문서·처리량·도착지·반출 조건을 대입하는 일입니다. 읽힐 문서 종류와 월 처리 건수, 결과가 들어갈 시스템 세 가지만 정리해 두면 개인용 도구로 충분한 구간인지부터 갈라 볼 수 있습니다. 임팩트플로우는 B2B SaaS 매칭 플랫폼으로, 기업에 최적화된 OCR·데이터 추출 솔루션을 연결합니다.

전자결재·계약
지금, 우리 회사에 딱 맞는
솔루션을 만나보세요

3분만에 간편하게, 무료로 받아보는 맞춤 추천

무료 추천받기 ›