PDF 텍스트 추출기
문서 전체는 비워 두고, 특정 페이지는 1-5, 8 처럼 적으세요.
파일은 이 페이지 안에서 열리고 읽힙니다. 업로드되지 않으므로 나중에 서버에 저장되거나 삭제될 것도 없습니다.
이 추출기가 하는 일
PDF 한 쪽은 그리기 명령의 목록이고, 거기 보이는 단어들은 대개 그림이 아니라 실제 텍스트 객체입니다. 이 페이지는 그 객체를 직접 읽으므로 검색하고 인용하고 편집할 수 있는 문자를 얻게 되며, 파일은 컴퓨터를 벗어나지 않습니다.
사용 방법
- 1 상자에 PDF를 끌어다 놓거나 클릭해 파일을 고르세요.
- 2 일부만 필요하면 페이지 범위를 지정하고, 줄바꿈을 유지할지 고르세요.
- 3 텍스트 추출을 누른 뒤 결과를 복사하거나 .txt 파일로 내려받으세요.
추출은 OCR과 다릅니다
PDF가 워드프로세서나 청구 시스템에서 나온 것이라면 문자가 이미 안에 들어 있어 읽기가 정확합니다. 스캐너나 휴대폰 카메라에서 온 것이라면 그 쪽은 사진일 뿐이라 읽을 문자가 없습니다. 그 글자를 알아보는 일은 광학 문자 인식이며, 전혀 다른 데다 훨씬 덜 정확한 작업입니다. 이 도구는 빈 상자를 돌려주는 대신 어느 쪽인지 알려 줍니다.
줄바꿈은 어디서 오는가
PDF는 줄이나 문단을 기록하지 않고, 좌표에 놓인 글자만 담습니다. 읽는 쪽은 같은 높이에 있는 조각을 한 줄로 묶고 높이가 바뀌면 새 줄을 시작합니다. 일반 문서에서는 잘 맞지만 다단 편집에서는 완벽하지 않아, 한 쪽의 두 단이 서로 섞일 수 있습니다.
페이지 고르기
범위 입력란은 낱장과 구간을 쉼표로 구분해 받습니다. 중복은 버려지고 페이지는 순서대로 읽히므로 순서를 뒤섞어 써도 문제없습니다. 범위를 벗어난 숫자는 조용히 무시되지 않고 거부됩니다. 몰래 건너뛴 페이지는 결국 당신이 알아채지 못할 누락된 텍스트이기 때문입니다.
1-5 → 1, 2, 3, 4, 5 2, 7, 9 → 2, 7, 9 1-3, 10 → 1, 2, 3, 10 (bos) → 모든 페이지
서식에 대한 참고
출력은 서식 없는 텍스트이므로 굵은 글씨, 제목, 표, 이미지는 남지 않습니다. 표는 셀 경계가 사라진 단어 줄이 됩니다. 배치를 유지해야 한다면 문서 형식으로 변환하는 것이 맞고, 페이지를 그림으로만 원한다면 PDF를 JPG로, PDF를 PNG로 변환하는 페이지가 그 일을 합니다.