PDF를 워드로 바꾸면 무엇이 남고 무엇이 사라지나

PDF를 워드로 바꿨더니 표가 어긋나 있다. 변환기가 나쁜 건가 싶어 다른 걸 써 봐도 비슷하다. 도구를 바꿔도 해결되지 않는 종류의 문제가 있다.

Ashton
파일 형식

이유를 알면 어떤 도구를 고를지, 어디까지 기대할지가 정해진다.

PDF는 문서가 아니라 인쇄물이다

PDF 안에 들어 있는 것은 "가로 72, 세로 680 자리에 이 글자를 찍어라" 같은 지시의 긴 목록이다. 어디서 문단이 끊겼는지, 어느 줄과 어느 줄이 한 표의 같은 행이었는지는 파일 어디에도 적혀 있지 않다.

워드에서 PDF로 내보내는 순간 그 정보가 버려지기 때문이다. 종이에 인쇄할 때 문단 정보가 필요 없는 것과 같다. 그래서 되돌리는 일은 변환이 아니라 복원이다. 글자가 놓인 자리를 보고 원래 모양을 추측하는 것이다.

이 문장 하나가 나머지를 다 설명한다. 표가 어긋나는 것은 변환기가 표를 잘못 읽어서가 아니라, 읽을 표가 애초에 없어서 자리만 보고 표를 다시 지어내기 때문이다.

추측할 수 있는 것과 아예 없는 정보

이 둘을 구분하면 무엇이 개선 가능하고 무엇이 불가능한지가 갈린다.

  • 추측할 수 있는 것. 문단 구분(줄 간격과 줄 끝 위치로), 표(칸이 여러 줄에 걸쳐 줄 맞춰 섰는지로), 제목(본문보다 큰 글씨인지로). 알고리즘이 좋아지면 정확도가 올라간다.
  • 그대로 꺼낼 수 있는 것. 글자, 그리고 쪽에 박혀 있는 그림과 도장. 이것들은 실물이라 추측이 필요 없다.
  • 아예 없는 정보. 원본이 어떤 워드 스타일을 썼는지, 표의 셀이 어디서 합쳐졌는지, 문단 사이 여백이 몇 포인트였는지. 어떤 도구도 이건 못 만들어 낸다.

배치를 똑같이 만드는 변환기를 조심하라

변환 결과가 원본과 픽셀 단위로 똑같다고 광고하는 도구가 있다. 실제로 열어 보면 정말 똑같다. 그런데 한 줄을 고치는 순간 문서가 무너진다.

그렇게 만들려면 글자를 문단이 아니라 글상자에 담아 좌표에 박아야 하기 때문이다. 글상자 수백 개가 각자 제자리에 떠 있는 문서는 보기에는 원본이지만 편집할 수는 없다. 글자 하나를 지우면 그 상자만 줄고 나머지는 그대로 있다.

무엇을 원하나고를 것
내용을 읽고 고쳐야 한다문단으로 되살리는 도구
보기만 하면 된다변환하지 말고 PDF 뷰어로 보기
인쇄본과 똑같아야 한다변환하지 말고 PDF 그대로 쓰기
표의 숫자를 계산해야 한다엑셀로 변환

변환은 고치기 위해 하는 일이다. 고칠 수 없는 결과물은 목적을 잃는다. 원본과 똑같아 보이는 것이 목적이라면 애초에 변환할 이유가 없다.

표가 어긋나는 진짜 이유

PDF의 표에는 선이 없는 경우가 아주 흔하다. 있더라도 그 선은 글자와 다른 층에 그려져 있어서, 글을 꺼내는 쪽에서는 보이지 않는다. 선을 찾아 표를 알아내려는 방법이 자주 실패하는 이유다.

그래서 자리를 본다. 칸의 왼쪽 끝이 여러 줄에 걸쳐 같은 자리에 서 있으면 표로 본다. 이 방법은 값이 빈 칸에서 약해진다. 빈 칸은 PDF 안에 아무 흔적도 남기지 않으므로, 그 줄만 칸이 하나 적어 보이고 결과가 한 칸씩 밀린다.

합쳐진 셀도 마찬가지다. 사람 눈에는 두 칸이 합쳐진 것이 보이지만 파일 안에는 그냥 글자 하나가 조금 왼쪽에 있을 뿐이다.

스캔한 PDF는 어떤 도구로도 안 된다

복합기로 스캔해 만든 PDF는 쪽 전체가 사진 한 장이다. 사람 눈에는 글자로 보이지만 파일 안에는 글자가 한 자도 없다. 이건 도구의 성능 문제가 아니라 원본에 정보가 없는 문제다.

글자 인식(OCR)을 쓰면 만들어 낼 수는 있다. 다만 그것은 추출이 아니라 인식이라 숫자 0과 영문 O를 뒤바꾸는 식의 오류가 섞인다. 계약서나 제출 서류에서는 그 오류가 비싸다. 가능하면 발급처에 원본 파일을 요청하는 편이 빠르다.

정리하면

변환기를 고를 때 물어볼 것은 "얼마나 똑같은가" 가 아니라 "고칠 수 있는가" 다. 그리고 결과가 완벽하지 않을 때, 그것이 도구의 한계인지 형식의 한계인지 구분할 수 있으면 헛되이 도구를 갈아 끼우는 시간을 아낄 수 있다.

자주 묻는 것

변환기마다 결과가 다른 이유는 뭔가요?
추측하는 규칙이 다르기 때문입니다. 줄 간격이 얼마나 벌어져야 문단이 끊긴 것으로 볼지, 칸이 몇 줄 이상 줄 맞춰 서야 표로 볼지 같은 기준을 저마다 다르게 잡습니다. 그래서 문서 종류에 따라 잘 맞는 도구가 갈립니다.
표가 자꾸 어긋납니다. 방법이 없나요?
값이 빈 칸이 많은 표일수록 어긋납니다. 빈 칸이 PDF 안에 흔적을 남기지 않기 때문입니다. 표만 필요하다면 워드보다 엑셀로 바꾸는 편이 낫습니다. 엑셀 쪽은 칸을 열에 떨어뜨리는 처리를 따로 하고, 어긋나도 손으로 고치기 쉽습니다.
그림과 도장도 넘어오나요?
넘어옵니다. 쪽에 박혀 있는 실물이라 추측 없이 그대로 꺼냅니다. 다만 놓이는 자리는 원래 좌표가 아니라 글의 순서를 따릅니다. 좌표에 박으면 고칠 수 없는 문서가 되기 때문입니다.
글꼴이 바뀌어 나옵니다.
PDF는 글꼴 파일 자체를 품고 있지만 그것이 원본 문서가 지정한 글꼴 이름과 같다는 보장이 없고, 받는 쪽 컴퓨터에 그 글꼴이 깔려 있다는 보장은 더욱 없습니다. 그래서 글꼴은 옮기지 않고 기본 글꼴로 둡니다.
파일을 올리지 않는 변환기가 있나요?
있습니다. 이 사이트의 도구가 그렇습니다. 변환이 전부 브라우저 안에서 끝나므로 서버로 올라가는 단계가 없습니다. 확인하려면 개발자 도구의 네트워크 탭을 열어 두고 변환을 눌러 보면 됩니다.

최종 수정 2026년 9월 17일