문서·디지털 · TOOLKIT GUIDE

이미지·스캔 PDF 글자 추출 가이드: 한글 OCR 준비부터 검수·저장까지

사진·스캔 PDF에서 한글과 영문을 추출하는 OCR 사용법입니다. 일반 PDF 글자 추출과의 차이, 촬영·언어·페이지 범위 설정, 숫자와 표 검수, 수정·TXT 저장을 업무 사례로 설명합니다.

먼저 알아두세요

사진이나 스캔 PDF에서 복사할 수 없는 글자를 가져오려면 OCR을 사용합니다. 먼저 문서에 원래 텍스트가 들어 있는지 확인하고, 사진의 방향·선명도·언어를 맞춘 뒤 인식 결과를 원본과 대조하세요. 툴킷에서는 한글·영문 인쇄체를 브라우저 안에서 인식하고 페이지별로 수정해 TXT로 저장할 수 있습니다. 아래에는 도구 선택 기준, 촬영 준비, 페이지 범위, 검수 순서와 업무 사례를 정리했습니다.

한글·영문 인쇄체 이미지와 스캔 PDF를 일반 텍스트로 옮기는 실무 안내입니다. 인식 결과의 정확성을 보증하거나 원본 문서를 대체하지 않습니다. 손글씨 전용 인식, 표를 엑셀 셀로 복원하기, 검색 가능한 PDF 생성, 번역은 이 도구의 제공 범위에 포함되지 않습니다.

01PDF 글자 추출과 OCR, 파일 상태부터 구분하세요

PDF라는 확장자만으로 어떤 도구를 써야 할지 결정하기는 어렵습니다. 같은 PDF라도 문서 프로그램에서 내보낸 파일에는 글자 정보가 들어 있고, 종이를 스캔한 파일에는 사진만 들어 있을 수 있습니다. 우선 뷰어에서 문장 일부를 드래그해 복사한 뒤 메모장에 붙여넣어 보세요. 눈에 보이는 문장과 붙여넣은 내용이 일치하면 기존 PDF 글자 추출 도구부터 사용하는 편이 좋습니다.

복사할 수 없거나 페이지 전체가 한 장의 이미지로 선택된다면 OCR이 필요한 경우가 많습니다. OCR은 이미지에 있는 글자 모양을 읽어 새로운 문자열을 만드는 과정입니다. 따라서 원래 글자를 가져오는 방식과 달리 비슷하게 생긴 문자를 잘못 읽을 수 있습니다. 글자 추출은 빠르지만 사진에는 적용되지 않고, OCR은 사진에 적용되지만 검수가 필요하다는 점을 구분하면 도구를 선택하기 쉽습니다.

일부 PDF는 사진 위에 이미 OCR 결과가 얹혀 있습니다. 이때 글자가 선택된다고 해서 선택된 내용이 정확하다는 뜻은 아닙니다. 예를 들어 화면에는 2026이 보이는데 복사하면 2028이 된다면 기존 인식 결과가 틀렸을 수 있습니다. 필요한 부분을 새로 인식하거나 직접 수정하되, 화면에 보이는 원본을 기준으로 판단하세요. 한 파일 안에서도 본문은 텍스트이고 부록은 스캔 이미지인 혼합 문서가 있을 수 있으므로 대표 페이지 몇 장을 확인하는 것이 좋습니다.

입력 상태에 따른 시작 도구
문서 상태먼저 할 일확인할 점
문장이 정상적으로 복사되는 PDFPDF 글자 추출문단 순서와 줄바꿈
사진·캡처·이미지만 있는 PDF이미지·스캔 PDF OCR오탈자·누락·숫자
페이지마다 형식이 다른 PDF각 페이지를 확인해 나눠 처리스캔 부록이 빠지지 않았는지
이미 인식됐지만 복사 내용이 틀린 PDF원본 이미지와 대조 후 재인식기존 오류를 그대로 재사용하지 않는지

02작업 전에 필요한 결과를 한 문장으로 정하세요

처음부터 문서 전체를 완벽하게 재현하려고 하면 불필요한 작업이 늘어납니다. 회의 안내문의 날짜와 준비물을 복사하려는지, 스캔한 보고서의 특정 문단을 인용하려는지, 여러 영수증의 금액을 정리하려는지 먼저 정해보세요. 목적이 분명하면 인식할 페이지와 검수할 항목도 줄어듭니다. 원본에 있는 글자를 옮기는 일과 원본의 의미를 해석하는 일은 별도로 진행하는 것이 좋습니다.

툴킷 OCR의 출력은 일반 텍스트입니다. 굵은 글씨, 배경색, 도장, 그림의 위치와 표 테두리는 텍스트 결과에 보존되지 않습니다. 신청서 양식을 그대로 수정하거나 보고서 디자인을 유지한 채 편집하려는 목적이라면 이 출력만으로 작업이 끝나지 않습니다. 글자를 확보한 다음 문서 편집기에서 서식을 다시 잡는 단계가 필요합니다. OCR 결과를 저장해도 원본 PDF가 바뀌지 않는다는 점도 알아두세요.

짧은 메모 하나를 만드는 작업이라면 필요한 문단만 처리하고 바로 확인해도 충분합니다. 반대로 인용문이나 기록 보관용 텍스트라면 원본 파일명, 원본 페이지, 검수 여부를 함께 메모하세요. 나중에 문장이 잘못 옮겨졌을 때 출처를 다시 찾을 수 있어야 합니다. 여러 문서의 내용을 한 파일에 모을 때에는 출처가 바뀌는 지점에 제목을 직접 넣어두면 서로 다른 문서가 하나의 주장처럼 이어지는 일을 줄일 수 있습니다.

03인식 버튼보다 먼저, 촬영 상태를 확인하세요

글자가 선명한 원본을 준비하는 것이 첫 단계입니다. 휴대폰으로 종이를 찍는다면 종이를 평평하게 놓고 카메라를 문서와 최대한 나란하게 맞춰보세요. 비스듬히 찍은 사진은 위쪽과 아래쪽의 글자 크기가 달라져 읽기 어려워집니다. 화면에서 문서가 크게 보이더라도 초점이 흐리거나 흔들렸다면 재촬영하는 편이 빠를 수 있습니다. 촬영 후 숫자 한 줄을 확대해 사람이 구분할 수 있는지 확인하세요.

형광등이나 창문 빛이 종이에 반사되면 일부 글자가 흰색으로 날아갈 수 있습니다. 반대로 손과 휴대폰 그림자가 문장을 덮으면 획이 붙어 보입니다. 밝은 곳에서 문서 위치를 조금 바꾸고, 접힌 부분이나 곡면 때문에 글자가 휘어 보이지 않는지 살펴보세요. 원본이 책이라면 가운데 접힌 부분의 글자를 특히 확인해야 합니다. 페이지를 강하게 펴서 손상시키기보다는 필요한 부분을 나눠 촬영하는 방법을 고려하세요.

메신저를 거쳐 받은 작은 사진을 여러 번 압축한 경우, 저장 형식을 바꾸는 것만으로 사라진 획이 복구되지는 않습니다. 가능하면 전송한 사람에게 원본 크기 파일을 받거나 원래 자료에서 다시 캡처하세요. 글자 주변에 넓은 배경이 있으면 촬영 단계나 사진 편집기에서 문서 부분을 중심으로 정리할 수 있습니다. 다만 글자 끝이나 각주를 잘라내지 않도록 여백을 조금 남겨두세요. 툴킷 OCR 자체에는 자유 영역 자르기 기능이 없으므로 필요한 자르기는 파일을 선택하기 전에 준비합니다.

04예제 한 장으로 전체 흐름을 익히세요

처음 사용한다면 예제로 체험하기를 눌러 준비된 안내문 이미지를 열어보세요. 이 예제는 개인 문서 없이 파일 열기, 인식, 수정, 복사와 저장을 연습하기 위한 자료입니다. 예제 이미지가 원본 미리보기에 나타나면 한국어와 영어가 함께 있는지, 글자가 정방향인지 살펴보세요. 글자 인식하기를 누른 뒤에는 엔진 준비 단계와 실제 인식 단계가 차례로 표시됩니다.

첫 실행에서는 인식 프로그램과 언어 데이터를 내려받기 때문에 같은 기기에서 두 번째 작업보다 준비 시간이 길 수 있습니다. 진행 중에는 탭을 열어두고 상태 문구를 확인하세요. 일정 시간 동안 처리하지 못하면 오류 안내가 표시되므로 여러 번 연속해서 버튼을 누를 필요는 없습니다. 이동 중에 연결이 끊어졌다면 네트워크가 안정된 뒤 다시 시도하세요. 파일 내용이 서버로 전송되는 과정은 아니지만 프로그램을 불러오는 인터넷 연결은 필요합니다.

예제 결과가 나타나면 맨 앞 제목부터 맨 끝 숫자까지 줄별로 대조해보세요. 결과가 자연스러운 문장이라고 해서 모든 줄이 들어온 것은 아닙니다. 누락된 줄이 있다면 다른 글자 배치 설정으로 다시 실행해 결과를 비교할 수 있습니다. 설정을 바꾸고 다시 인식하면 이전 결과가 지워지므로 직접 고친 내용이 있다면 먼저 복사하거나 저장하세요. 마지막에는 결과를 한 글자 수정해 TXT에 그 수정이 반영되는지까지 확인하면 실제 문서를 처리할 준비가 됩니다.

05언어와 글자 배치는 문서에 맞게 선택하세요

한국어 안내문에 영문 제품명이나 이메일이 섞여 있다면 한국어 + 영어로 시작하세요. 영어로만 작성된 문서는 영어를 선택할 수 있습니다. 언어 설정은 어떤 글자 모양을 읽을지 정하는 옵션이며 번역 기능이 아닙니다. 영어 문서를 한국어로 선택한다고 한국어 문장으로 바뀌지 않습니다. 한자나 일본어가 많이 포함된 문서도 현재 지원 언어만으로 정확히 처리된다고 기대해서는 안 됩니다.

글자 배치의 자동 모드는 일반 문서에서 시작하기 좋은 선택입니다. 한 덩어리 모드는 한 방향으로 이어지는 문단이나 단순한 안내문을 다시 시도할 때 사용할 수 있습니다. 흩어진 글자 모드는 안내판처럼 문장이 여기저기 떨어져 있는 이미지에서 비교해볼 수 있습니다. 문서 유형 이름은 출발점을 제안하는 것이며 어느 모드가 항상 더 정확하다는 뜻은 아닙니다. 실제 출력에서 제목이나 짧은 문장이 빠지는지 확인하며 선택하세요.

모드를 비교할 때에는 원본 파일과 다른 설정을 동시에 여러 개 바꾸기보다 한 가지씩 바꾸는 편이 원인을 찾기 쉽습니다. 예를 들어 같은 사진에서 자동 모드로 제목이 빠졌다면 방향과 언어는 그대로 두고 한 덩어리 모드로 다시 실행합니다. 결과에 제목이 돌아왔는지, 대신 다른 줄의 순서가 달라졌는지 함께 확인하세요. 원하는 결과를 얻었다면 그때부터 오탈자를 고치는 것이 효율적입니다. 모드 변경 전의 수정본이 필요하면 미리 저장해야 합니다.

06긴 PDF는 페이지 범위를 나눠 처리하세요

툴킷 OCR은 파일당 10MB 이하, 최대 100페이지 PDF를 열고 한 번에 10페이지까지 인식합니다. 긴 파일을 열면 처음 범위는 앞쪽 최대 10페이지로 채워집니다. 실제로 필요한 페이지를 확인한 뒤 범위를 바꾸세요. 예를 들어 표지와 목차를 제외한 본문만 필요하다면 3-7처럼 지정할 수 있습니다. 서로 떨어진 부분이 필요하면 2, 5-7처럼 쉼표로 나눠 입력합니다.

페이지 번호는 PDF 파일 안에서의 물리적인 순서입니다. 종이에 인쇄된 쪽수와 일치하지 않을 수 있습니다. 표지가 첫 번째 페이지이고 본문에 1쪽이라고 적혀 있다면, 본문 1쪽은 파일에서는 두 번째나 세 번째 페이지일 수 있습니다. 비교할 원본 페이지에서 실제 화면을 보고 번호를 정하세요. 부록에 별도 쪽번호가 시작되는 문서는 특히 혼동하기 쉽습니다.

범위를 5, 2-3으로 입력하면 결과도 5페이지, 2페이지, 3페이지 순서로 모입니다. 중복 번호나 거꾸로 된 범위는 허용하지 않습니다. 10페이지를 넘는 경우에는 범위를 줄여 다시 실행하세요. 빈칸은 전체 페이지를 뜻하므로 10페이지가 넘는 파일에서 빈칸으로 실행하면 제한 안내가 나옵니다. 완료된 묶음을 TXT로 저장한 뒤 다음 범위로 넘어가면 작업을 잃지 않습니다. 저장 파일 이름에 원본 식별명과 범위를 넣어두면 여러 묶음을 구분하기 편합니다.

07방향과 크기 때문에 생기는 오류를 줄이세요

옆으로 누운 사진은 인식 전 회전에서 90도 또는 270도를 선택해 정방향으로 돌려보세요. 거꾸로 된 사진은 180도를 선택합니다. 회전은 인식용 이미지에만 적용되고 원본 파일을 덮어쓰지 않습니다. PDF에서는 선택한 모든 페이지에 같은 회전이 적용되므로, 정방향 페이지와 옆으로 누운 페이지가 섞여 있다면 방향이 같은 페이지끼리 나눠 인식하는 것이 좋습니다.

미리보기는 문서가 제대로 열렸는지와 방향을 확인하는 화면입니다. 좁은 화면에 맞춰 줄여 보이므로 글자가 작게 보인다고 곧바로 인식용 이미지도 같은 크기라고 판단하지 마세요. PDF는 약 200dpi를 목표로 이미지화하되 메모리 사용을 제한하기 위해 페이지당 800만 픽셀과 긴 변 6,000픽셀 범위 안으로 조절합니다. 아주 큰 도면이나 포스터는 제한에 따라 세부 글자가 작아질 수 있습니다.

이미지는 원본이 2,500만 픽셀 이하인 경우에 열 수 있고, 인식 단계에서는 더 작은 크기로 줄어들 수 있습니다. 세로로 매우 긴 캡처는 전체 면적뿐 아니라 긴 변 제한의 영향도 받습니다. 결과에서 작은 글자가 계속 빠진다면 원본을 여러 부분으로 나눠 저장한 뒤 각각 처리하는 방법을 고려하세요. 압축률을 높여 용량만 줄이는 것은 글자 선명도를 해칠 수 있으므로, 처리할 구역을 줄이는 방법과 구분해서 선택해야 합니다.

08검수는 전체 누락, 순서, 중요 숫자 순서로 하세요

검수를 시작할 때에는 단어 하나씩 고치기 전에 문서 전체 구조부터 확인하세요. 제목이 있는지, 첫 문장과 마지막 문장이 들어왔는지, 문단 개수가 크게 다르지 않은지 살펴봅니다. 페이지 머리말이나 바닥글이 본문 중간에 끼어 있지는 않은지도 확인하세요. 한 문단이 통째로 빠져 있는데 띄어쓰기만 고치는 일부터 시작하면 누락을 발견하기가 오히려 어려워집니다.

다음으로 읽기 순서를 확인합니다. 좌우 두 단으로 나뉜 문서는 왼쪽 전체 다음 오른쪽 전체로 읽어야 할 수도 있고, 표처럼 같은 높이에 있는 내용을 한 줄씩 읽어야 할 수도 있습니다. OCR이 선택한 순서가 원문의 의미와 일치하는지 사람이 판단해야 합니다. 결과가 앞뒤 문맥 없이 갑자기 다른 주제로 넘어가면 단 순서나 삽입 상자가 섞였는지 확인해보세요.

숫자는 문장이 자연스러운지 읽는 것만으로 검수하기 어렵습니다. 날짜, 시간, 금액, 단위, 전화번호, 계좌나 문서 식별번호처럼 실수의 영향이 큰 항목을 따로 골라 원본과 한 글자씩 대조하세요. 0과 O, 1과 I, 5와 S처럼 비슷하게 보이는 문자가 바뀔 수 있습니다. 쉼표, 소수점, 음수 기호와 괄호도 확인합니다. 금액 12,500과 125,000은 한 글자 차이지만 의미가 크게 달라집니다.

원본에서도 읽기 어려운 부분은 추측으로 채우지 않는 것이 좋습니다. 개인 작업 메모라면 확인 필요처럼 표시하고 원본을 다시 받아 확인하세요. OCR은 문서 내용의 사실 여부나 효력을 판단하지 않습니다. 인식 결과를 업무 자료로 사용하기 전에는 원본 대조가 끝난 부분과 아직 확인하지 못한 부분을 구분해두세요.

09영수증과 표는 숫자보다 행의 연결을 먼저 확인하세요

표에서 가장 위험한 오류는 숫자 자체보다 항목과 숫자의 연결이 바뀌는 경우입니다. 이름 세 개와 금액 세 개가 모두 인식되어도 서로 다른 행끼리 연결되면 잘못된 자료가 됩니다. OCR 결과를 그대로 엑셀에 붙여넣기 전에 원본의 첫 번째 항목에 어떤 금액이 붙는지 확인하세요. 셀 안의 줄바꿈이나 병합 셀 때문에 한 항목이 여러 줄로 나타날 수도 있습니다.

툴킷 OCR은 표를 엑셀 셀로 복원하지 않습니다. 결과에 공백이 여러 개 있다고 해서 각 열을 정확히 구분하는 구분자라고 가정하지 마세요. 표가 필요한 경우 먼저 항목명, 수량, 단가, 금액처럼 원하는 열을 문서나 스프레드시트에 만들고 인식 결과를 참고해 값을 옮기는 편이 안전합니다. 행이 많다면 일부를 샘플 검수하는 것만으로 충분한지 작업 목적에 맞춰 판단하세요.

영수증에는 매장명, 결제 시각, 품목, 세금, 합계, 승인번호처럼 성격이 다른 숫자가 가까이 있습니다. 합계를 찾으려다가 승인번호를 금액으로 가져오지 않도록 각 숫자의 이름을 함께 확인하세요. 취소나 환불 표시는 마이너스 기호 또는 별도 문장으로 나타날 수 있습니다. 숫자가 모두 양수처럼 인식되면 지출의 방향까지 달라질 수 있으므로 원본의 취소 표시와 결제 상태를 함께 읽어야 합니다.

품목 금액의 합계와 최종 결제 금액이 다르다면 곧바로 OCR 오류라고 결론 내리지 마세요. 할인, 포인트 사용, 배송비처럼 별도 항목이 있는지 먼저 확인할 수 있습니다. 계산이 맞는다고 해서 모든 글자가 맞는 것도 아니므로, 검산과 원본 대조는 함께 사용하는 확인 방법으로 생각하세요.

10사례: 사진으로 받은 회의 안내문을 일정 메모로 바꾸기

사진 속 안내문에 회의 제목, 날짜, 시간, 장소와 준비물이 있다고 가정해보겠습니다. 목적은 안내문 디자인을 옮기는 것이 아니라 일정에 필요한 정보를 정확히 복사하는 것입니다. 사진 한 장을 열고 정방향인지 확인한 뒤 한국어 + 영어로 인식합니다. 제목과 본문이 떨어져 있거나 아이콘 옆에 짧은 문장이 놓여 있다면 자동 모드 결과에서 누락 여부를 먼저 살펴보세요.

인식된 내용에서 날짜와 요일을 읽고, 오전과 오후가 빠지지 않았는지 확인합니다. 장소는 건물명뿐 아니라 층과 회의실 번호도 대조하세요. 원문에 별관이라고 적혀 있는데 그 단어가 빠지면 전혀 다른 장소로 안내할 수 있습니다. 준비물과 참석 대상도 별도 문장으로 옮기고, 반드시 또는 선택 같은 조건이 삭제되지 않았는지 살펴봅니다.

검수를 마친 뒤에는 결과 수정란에서 일정 메모에 맞게 줄을 나눌 수 있습니다. 제목, 일시, 장소, 준비물 순서로 정리하면 다른 앱에 붙여넣기 편합니다. 다만 재구성한 메모와 원문의 표현을 구분하고 싶다면 먼저 원문에 가까운 수정본을 저장해두세요. 일정 앱에 옮긴 다음에는 앱이 날짜와 시간을 자동 해석했더라도 실제 등록된 값을 한 번 더 확인하는 것이 좋습니다. 텍스트를 정확히 복사하는 일과 일정 필드에 정확히 입력되는 일은 별개의 단계입니다.

11사례: 스캔 보고서의 필요한 문단만 가져오기

스캔 보고서 40페이지 중 12페이지와 15~16페이지에 있는 설명만 필요한 상황을 생각해보세요. 파일을 열고 비교할 원본 페이지에서 각 페이지의 제목을 확인한 뒤 범위에 12, 15-16을 입력합니다. 실제 인쇄된 쪽번호와 파일 순서가 다른지 여기서 확인해야 합니다. 인식 후 결과 페이지를 바꿔가며 필요한 문단이 모두 들어왔는지 확인합니다.

보고서에는 각주 번호, 그림 설명, 표 제목과 본문이 가까이 있을 수 있습니다. 결과에 문장 중간 숫자가 끼어 있으면 각주 표시인지 본문의 일부인지 원본에서 확인하세요. 각주 내용을 삭제해도 되는지 여부는 단순한 글자 정리 문제가 아닙니다. 본문의 조건이나 출처를 설명하는 각주라면 본문과 함께 남겨야 의미가 달라지지 않습니다. 인용하려는 문장의 앞뒤 문맥도 같이 확인하세요.

원문 인용이 목적이라면 띄어쓰기나 표현을 자연스럽게 바꾸는 편집과 인식 오류 수정의 경계를 구분하세요. 원본에 실제로 있는 표현은 어색해 보여도 임의로 고치지 않고, OCR이 틀리게 읽은 글자만 바로잡는 방식이 적합할 수 있습니다. 결과 TXT에는 페이지 구분이 들어가므로 나중에 출처를 다시 찾을 때 활용할 수 있습니다. 다른 문서로 붙여넣을 때에도 보고서 제목과 원본 페이지를 함께 기록하면 검수와 출처 확인을 이어가기 쉽습니다.

12사례: 제품 목록과 연락처를 텍스트로 옮기기

제품 라벨이나 명함처럼 짧은 텍스트도 인식 후 확인할 부분이 많습니다. 제품명은 일반 사전에 없는 영문과 숫자가 섞이고, 연락처에는 하이픈과 마침표가 들어갑니다. 한국어 설명과 영문 모델명이 함께 있는 사진이라면 혼합 언어로 시작하고, 결과를 자연스러운 단어로 바꾸려 하지 말고 원본의 문자 배열을 확인하세요. 제품 코드에서 대소문자나 한 자리 숫자가 바뀌면 다른 제품을 가리킬 수 있습니다.

여러 항목을 한 번에 옮길 때에는 항목마다 원본의 경계를 유지하는 것이 좋습니다. 예를 들어 모델명, 수량, 보관 위치가 한 줄에 있는 목록이라면 세 항목이 서로 섞이지 않았는지 확인한 다음 줄별로 정리하세요. 품번 앞의 0은 숫자 계산에서 중요하지 않아 보여도 식별자에서는 의미가 있을 수 있습니다. 나중에 스프레드시트에 붙여넣을 경우 자동 숫자 변환으로 앞자리 0이 사라지지 않는지도 확인해야 합니다.

이메일 주소와 웹 주소는 문장 안에서 눈으로 읽으면 오류를 놓치기 쉽습니다. 주소에 쓰이는 영문자, 숫자, 마침표, 하이픈과 밑줄을 원본과 비교하고, 결과에 줄바꿈이나 공백이 끼어 있으면 정리하세요. 인식한 주소가 실제로 신뢰할 수 있는 곳인지는 OCR이 판단하지 않습니다. 문서에서 보이는 주소라는 이유만으로 중요한 정보를 보내기 전에 그 주소의 출처와 용도를 확인하세요. 연락처를 다른 사람에게 공유할 때에는 작업에 필요한 항목만 남겨두는 것이 관리하기 편합니다.

13수정·복사·TXT 저장을 끝까지 확인하세요

인식이 끝나면 현재 선택한 페이지의 결과 수정란에서 글자를 직접 고칠 수 있습니다. PDF의 다른 페이지를 보려면 비교할 원본 페이지를 바꾸세요. 인식 완료 표시가 있는 페이지에는 해당 결과가 연결되어 있고, 범위에 포함되지 않은 페이지에는 결과가 없습니다. 수정한 내용은 현재 탭 안의 결과에 반영되며 원본 이미지나 PDF 파일을 덮어쓰지 않습니다.

전체 결과 복사는 완료된 모든 페이지를 인식한 순서대로 모읍니다. 지금 화면에 보이는 한 페이지만 복사하는 버튼이 아니므로 붙여넣은 결과의 범위를 확인하세요. 특정 페이지만 필요하다면 그 결과 수정란에서 원하는 부분을 직접 선택해 복사할 수 있습니다. 브라우저가 자동 복사를 제한하면 안내에 따라 직접 선택하는 방법을 사용하면 됩니다.

TXT 저장 준비를 누르면 현재 수정 내용을 반영한 다운로드가 만들어집니다. 결과 다운로드를 눌러 파일을 저장한 뒤 메모장이나 문서 편집기에서 열어 한글과 줄바꿈이 정상인지 확인하세요. TXT는 일반 텍스트이므로 표 서식이나 글자색이 없는 것이 정상입니다. 다운로드를 준비한 뒤 다시 내용을 고치면 기존 다운로드가 사라지므로 저장 준비를 다시 눌러 최신 내용으로 만들어야 합니다.

새 파일을 열거나 설정을 바꾸면 기존 결과가 지워집니다. 같은 문서를 여러 범위로 처리할 때에는 한 묶음의 검수와 저장을 끝낸 다음 범위를 바꾸세요. 여러 번 저장한 파일은 기기에 따라 이름 뒤에 번호가 붙을 수 있으므로 최종본의 이름을 정리하는 것이 좋습니다. 원본, 최초 인식본, 검수 완료본을 구분해두면 나중에 어떤 단계에서 내용이 달라졌는지 찾기 쉽습니다.

14브라우저 처리와 파일 보관 범위를 이해하세요

이 도구는 선택한 문서를 서버에 업로드해 분석하는 방식으로 구성되어 있지 않습니다. 브라우저가 파일을 읽고 인식용 이미지를 만든 뒤 기기 안에서 OCR 엔진을 실행합니다. 엔진과 한국어·영어 데이터는 툴킷 도메인에서 내려받습니다. 서버에는 문서 보관함이 없으며 사용자가 결과를 저장하지 않고 탭을 닫으면 이 작업 화면의 내용은 사라집니다.

브라우저 안에서 처리한다는 설명이 기기의 모든 기록이 자동으로 지워진다는 뜻은 아닙니다. 직접 다운로드한 TXT와 원본 파일은 저장한 폴더에 남고, 복사한 글자는 운영체제의 클립보드나 사용 중인 클립보드 관리 기능에 남을 수 있습니다. 다른 앱에 붙여넣거나 직접 전송한 내용은 그 앱의 저장·공유 방식에 따릅니다. 공용 기기에서는 작업을 마친 뒤 저장 위치와 복사한 내용의 사용 범위를 확인하세요.

툴킷의 방문 통계와 광고 처리는 사이트의 개인정보 안내에서 확인할 수 있습니다. OCR 기능의 통계에는 알려진 도구 식별자와 완료·복사·다운로드 같은 동작만 사용하며, 선택한 파일명이나 문서 내용, 인식 결과를 담지 않도록 구현했습니다. 문서의 처리 방식과 일반적인 사이트 방문 통계는 구분해서 이해하는 것이 좋습니다.

여러 페이지를 동시에 처리하지 않고 차례로 인식하는 이유는 기기의 메모리 부담을 줄이기 위해서입니다. 그렇더라도 큰 이미지와 긴 문서는 휴대폰에 부담을 줄 수 있습니다. 작업 중 브라우저가 느려지면 중지한 뒤 범위를 줄이고, 필요하면 PC에서 다시 실행하세요. 다른 앱으로 전환하거나 탭을 오래 백그라운드에 두면 기기 상태에 따라 작업이 지연되거나 탭이 새로 열릴 수 있으므로 긴 작업은 작은 묶음으로 저장하는 편이 좋습니다.

15빈 결과·읽기 실패·중지 상황별로 대응하세요

인식 완료가 나왔지만 결과가 비어 있다면 먼저 실제로 글자가 있는 페이지를 골랐는지 확인하세요. 표지나 빈 페이지를 선택했을 수 있습니다. 원본 미리보기에서 글자가 정방향이고 사람이 읽을 수 있을 만큼 선명한지도 확인합니다. 언어가 맞고 사진이 선명한데 제목만 빠진다면 다른 글자 배치 모드로 다시 시도해볼 수 있습니다. 빈 결과는 문서에 글자가 전혀 없다는 확정 판정이 아닙니다.

파일을 열지 못하는 경우에는 지원 확장자와 크기를 확인하세요. 이미지 파일은 JPG·PNG·WebP를 지원하고, 애니메이션이 있는 형식은 첫 프레임만 처리합니다. PDF는 암호가 없고 양식·전자서명 필드가 없는 파일을 대상으로 합니다. 비밀번호를 알고 있더라도 이 도구에서 암호를 입력해 해제하는 기능은 제공하지 않습니다. 파일이 손상되었다면 정상적으로 열리는 원본을 다시 받아야 합니다.

엔진을 준비하지 못했다는 안내가 나오면 안정적인 인터넷 연결에서 다시 시도하세요. 글자 인식 중 실패한다면 범위를 한 페이지로 줄이거나 더 작은 이미지로 시도할 수 있습니다. 같은 파일에서 항상 같은 페이지가 실패하면 그 페이지를 따로 확인하는 것이 도움이 됩니다. 실패한 결과를 정답처럼 이어 붙이기보다는 어디까지 완료됐는지 확인하고 나머지를 별도 작업으로 처리하세요.

중지를 누르면 진행 중인 인식을 멈추고 이미 완료된 페이지는 남습니다. 화면에 표시된 완료 개수와 원본 페이지 번호를 확인한 뒤 필요한 결과를 저장하세요. 아직 처리하지 못한 페이지는 빈 문자열로 완료 표시를 붙여주지 않습니다. 파일과 결과 지우기는 현재 원본과 결과를 화면에서 함께 비우는 기능입니다. 다시 시작하려면 파일을 재선택해야 하므로 수정 중인 결과가 필요한 경우 먼저 저장하세요.

16실제 업무에 쓰기 전 마지막 확인표

작업을 마치기 전에 결과가 용도에 맞는지 마지막으로 확인해보세요. 원하는 페이지를 모두 처리했는지, 파일 순서와 인쇄된 쪽번호를 혼동하지 않았는지, 첫 줄과 끝 줄이 빠지지 않았는지 살펴봅니다. 다음으로 문단과 표의 읽기 순서가 자연스러운지 확인하고, 날짜·금액·연락처와 같은 중요 항목을 원본과 대조합니다. 내용이 맞아도 다른 문서의 결과를 잘못 붙여넣었을 수 있으므로 출처도 함께 확인하세요.

반복 업무라면 본인에게 필요한 검수 항목을 짧게 정해두면 편합니다. 회의 안내문은 일시·장소·준비물, 영수증은 매장·결제일·합계·취소 여부, 보고서는 제목·원본 페이지·인용 범위처럼 문서 유형에 따라 다르게 만들 수 있습니다. 모든 문서에 같은 긴 체크리스트를 적용하기보다 오류가 실제로 문제를 일으키는 항목을 중심으로 확인하는 것이 실용적입니다.

마지막으로 다운로드한 파일을 한 번 열어 최신 수정본인지 확인하고, 이후 사용할 앱에서 필요한 형태로 붙여넣어 봅니다. 줄바꿈이 합쳐지거나 앞자리 0이 사라지는 문제는 OCR이 끝난 다음 단계에서 생길 수도 있습니다. 결과를 전달할 때에는 원본을 확인할 수 있는 방법과 검수 범위를 함께 남겨두면 받는 사람도 내용을 확인하기 쉽습니다. OCR은 반복 입력을 줄여주는 시작점으로 활용하고, 중요한 기록을 완성하는 마지막 확인은 원본을 기준으로 진행하세요.

저장 전에 확인할 항목
항목확인 질문
범위필요한 원본 페이지가 모두 포함됐나요?
누락제목·첫 문장·마지막 문장이 있나요?
순서문단과 표의 항목이 올바르게 연결되나요?
숫자날짜·금액·단위·연락처를 직접 대조했나요?
수정본TXT에 가장 최근 수정 내용이 들어 있나요?
출처원본과 페이지를 다시 찾을 수 있나요?

자주 묻는 질문

사진 속 한글을 인식하려면 앱을 설치해야 하나요?

툴킷 OCR은 웹페이지에서 실행하므로 별도 앱 설치 없이 사용할 수 있습니다. 실행에 필요한 프로그램과 언어 데이터는 인식할 때 브라우저로 내려받습니다. 첫 실행의 준비 시간이 기기와 네트워크에 따라 다를 수 있으며, 큰 문서는 한두 페이지부터 시험하는 것이 좋습니다.

스캔 PDF를 넣으면 검색 가능한 PDF가 만들어지나요?

현재 제공하는 결과는 수정·복사할 수 있는 텍스트와 TXT 파일입니다. 원본 PDF에 글자층을 추가하거나 검색 가능한 PDF를 새로 만들지 않습니다. 글자를 추출한 뒤에도 원본은 그대로 남으며 원본의 파일 구조나 디자인은 바뀌지 않습니다.

이미 복사되는 PDF도 OCR로 처리하는 것이 더 정확한가요?

정상적인 텍스트가 들어 있는 PDF라면 기존 글자 추출이 먼저입니다. OCR은 글자 모양을 다시 판단하므로 오히려 오탈자가 생길 수 있습니다. 복사 결과가 깨지거나 이미지로 된 부분만 필요한 경우에 OCR을 비교해서 사용하세요.

한글 손글씨와 복잡한 표도 정확히 읽을 수 있나요?

이 도구는 한글·영문 인쇄체를 중심으로 제공합니다. 손글씨, 흘림체, 흐린 사진과 복잡한 표는 누락이나 오인식이 많을 수 있습니다. 표의 글자가 나왔다고 해도 행과 열의 연결이 맞는지 따로 확인해야 하며, 엑셀 표로 자동 복원하지는 않습니다.

인식이 끝났는데 제목이 빠졌어요. 어떻게 하나요?

원본에서 제목이 선명한지와 방향을 확인한 다음 글자 배치 모드를 바꿔 다시 비교해보세요. 자동 모드가 떨어진 제목이나 짧은 문장을 놓칠 수 있습니다. 한 덩어리 또는 흩어진 글자 모드가 도움이 될 수 있지만 모든 문서에서 같은 결과를 보장하지 않습니다. 재인식 전에 기존 수정본이 필요하다면 저장하세요.

다른 페이지로 이동하면 수정한 내용이 없어지나요?

비교할 원본 페이지 선택을 바꾸는 동안에는 페이지별 수정 내용이 현재 탭에 유지됩니다. 새 파일 선택, 인식 설정 변경, 다시 인식, 지우기 또는 탭 닫기는 결과를 초기화할 수 있습니다. 범위를 바꿔 다음 묶음을 처리하기 전에 완료된 결과를 저장하세요.

문서가 서버에 저장되거나 통계로 수집되나요?

OCR 파일과 인식 결과는 브라우저 안에서 처리하며 서버로 전송하거나 보관하지 않도록 구현했습니다. 방문 통계용 동작 기록에는 문서 내용과 파일명을 넣지 않습니다. 직접 복사하거나 다운로드한 결과는 클립보드와 저장 폴더에 남을 수 있으며 사이트의 일반적인 통계·광고 처리는 개인정보 안내에서 별도로 확인할 수 있습니다.

중지한 뒤 일부 페이지만 저장할 수 있나요?

네. 중지하기 전에 인식이 완료된 페이지의 결과는 남습니다. 전체 결과 복사와 TXT 저장은 그 완료된 결과만 포함합니다. 진행 중이던 페이지가 완료되지 않았다면 포함되지 않으므로, 저장 전에 완료 개수와 페이지 번호를 확인하고 남은 범위를 따로 처리하세요.

공식 출처와 확인 기준

본문을 수정했습니다. 아래 공식 기술 문서와 툴킷의 제공 기능을 기준으로 작성했습니다. 브라우저와 원본 파일에 따라 결과가 달라질 수 있으므로 실제 결과를 확인하고 사용하세요.

가이드 작성·수정 원칙 →