영수증·스크린샷 등 이미지 속 글자를 텍스트로 추출 · 한글/영어 지원
인식 중…
이미지를 올리고 "텍스트 추출"을 눌러주세요.
업로드한 이미지는 인식 즉시 서버에서 삭제되며 저장되지 않습니다.

이미지 텍스트 추출(OCR)은 어떤 도구인가요

영수증을 찍어 두었는데 금액을 다시 타이핑해야 하거나, 스크린샷 속 문구를 복사하고 싶은데 그림이라 선택이 안 될 때가 있습니다. OCR은 그림 안의 글자 모양을 알아보고 편집 가능한 텍스트로 되돌려 주는 기술입니다. 이 화면은 서버에 설치된 오픈소스 인식 엔진 Tesseract에 이미지를 넘겨 결과 텍스트만 돌려받는 방식으로 동작합니다.

다른 이미지 도구들과 달리 여기서는 파일이 실제로 서버로 전송됩니다. 브라우저만으로는 문자 인식을 할 수 없기 때문입니다. 다만 전송된 파일은 임시 영역에만 잠시 머무르고, 인식이 끝나는 즉시 코드가 그 임시 파일을 지웁니다. 결과 텍스트도 화면으로 돌려줄 뿐 따로 기록해 두지 않습니다. 그래도 신분증이나 계좌 정보처럼 민감한 내용이 담긴 이미지라면 올리지 않는 편이 안전합니다.

인식 언어는 한글+영어, 한글만, 영어만 셋 중에서 고릅니다. 한글 문서에 영문 상호나 단위가 섞여 있으면 첫 번째를, 순수 영문 문서라면 세 번째를 고르는 편이 정확합니다. 언어를 좁힐수록 엉뚱한 글자로 잘못 읽는 경우가 줄어듭니다. 페이지 구조는 여러 줄 문단이 섞인 일반 문서에 맞춰 자동 분할 방식으로 처리하도록 맞춰 두었습니다.

인식률은 이미지 상태에 크게 좌우됩니다. 글자가 화면에서 작게 보일수록, 기울어져 있을수록, 조명이 고르지 않을수록 결과가 나빠집니다. 영수증이라면 구겨진 부분을 펴고 정면에서 밝게 찍은 사진이 가장 잘 읽힙니다.

사용 방법

  1. 맨 위에서 인식할 언어를 고릅니다.
  2. 점선 상자에 이미지를 끌어다 놓거나 눌러서 파일을 선택합니다. 미리보기와 파일 크기가 표시됩니다.
  3. 텍스트 추출을 누르고 인식이 끝날 때까지 기다립니다.
  4. 결과가 아래 칸에 나오면 결과 복사로 가져갑니다.
  5. 결과가 시원치 않으면 언어 설정을 바꾸거나 더 선명한 이미지로 다시 시도합니다.

궁금한 사항 있으신가요?