AX 용어사전

문서 파싱(Document Parsing)이란? PDF·HWP·HWPX 문서를 AI가 이해하는 구조로 바꾸는 과정

HANCOM

사내 AX를 진행하며 문서를 그대로 RAG에 넣었더니 검색 결과가 어긋나거나, 표 데이터가 깨져 곤란했던 경험이 있으신가요? 

PDF·HWP·HWPX·OOXML 같은 문서 안의 구조 정보는 단순 텍스트 추출만으로 보존하기 어렵죠. 안정적인 RAG 파이프라인 구축을 위해서는 문서 안의 의미를 살려 AI가 처리할 수 있는 데이터로 변환하는 단계가 필요해요. 그 단계가 바로 문서 파싱(Document Parsing)입니다. 

비정형, 반정형 데이터를 기계가 읽을 수 있는 구조화 표현으로 바꾸는 데이터 전처리 단계를 의미하는 문서 파싱에 대한 인포그래픽

문서 AI, 문서 파서(Document Parser)가 필요한 이유

대형 언어 모델인 LLM(Large Language Model)은 구조화된 텍스트를 중심으로 이해하기 때문에  PDF·HWP·HWPX·OOXML 같은 비정형·반정형 문서를 그대로 입력하면 표·계층·읽기 순서 같은 의미 정보가 사라지는 경우가 많습니다. 문서 안의 의미를 잃지 않으려면, 모델에 넣기 전에 문서 구조를 분석하고 다시 정리하는 단계가 필요합니다.

LLM이 이해하는 데이터의 형태

LLM은 텍스트를 토큰 단위로 쪼개어 입력받기 때문에, 문서가 표·다단·계층 같은 의미 단위로 정리되어 있어야 검색 단계와 답변 단계에서 맥락이 유지됩니다. 

이때 LLM이 외부 문서를 활용해 답변하는 방식을 RAG(검색 증강 생성)라고 합니다. RAG 프로세스는 문서 업로드 → 파싱 → 청킹 → 임베딩 → 벡터DB 저장 → 검색 → 답변 생성 순서로 동작합니다.

RAG 프로세스를 표현한 인포그래픽 문서 업로드 → 파싱 → 청킹 → 임베딩 → 벡터DB 저장 → 검색 → 답변 생성 순서로 동작.

파싱 단계에서 표·계층·읽기 순서가 제대로 정리되어 있어야 검색 단계에서 관련 정보를 정확하게 불러올 수 있습니다. 만약 구조가 손실된 데이터를 사용하게 될 경우, 검색을 통과하더라도 답변 단계에서 근거가 되는 맥락을 잃을 수 있습니다.

📚 함께 읽으면 좋은 글

[RAG란? 청킹·임베딩·벡터DB까지 – 파이프라인 전 단계 쉽게 이해하기

텍스트 추출만으로 복원되지 않는 복잡한 문서 구조

기업 문서에서는 핵심 정보가 본문보다 표·차트·계층 구조에 담겨 있는 경우가 많습니다. 하지만 단순 텍스트 추출만 진행하면 이런 구조 정보가 사라져, RAG 검색이나 답변 단계에서 문맥이 제대로 전달되지 않을 수 있습니다.

단순 텍스트 추출 방식은 문서를 글자 중심으로만 읽기 때문에, 제목·본문·표 사이의 구조 관계까지 함께 이해하지는 못합니다. 그래서 다단 레이아웃이나 복잡한 표가 포함된 문서에서는 텍스트 순서가 뒤섞이거나, 표 데이터 관계가 끊기는 문제가 발생할 수 있습니다. 문서 안의 계층 구조와 섹션 관계까지 함께 보존되지 않으면, LLM도 문맥을 정확하게 연결하기 어려워지죠.

문서 파싱이란, AI 전처리의 첫 단계

문서 파싱의 정의

문서 파싱(Document Parsing)은 PDF·HWP·HWPX·OOXML 등 비정형·반정형 문서에서 텍스트뿐 아니라 표·이미지·계층 구조를 분석해, AI가 활용할 수 있는 구조화 데이터(JSON·HTML·마크다운)로 변환하는 전처리 기술입니다.

쉽게 말해, 사람이 읽기 위해 작성된 문서를 AI가 검색하고 분석할 수 있는 형태로 정리하는 과정입니다. 이때 텍스트만 추출하는 것이 아니라 표·수식·차트·레이아웃 같은 구조 정보까지 함께 분석해야 문서의 의미를 정확하게 보존할 수 있습니다. 

텍스트 추출이 글자를 가져오는 단계라면, 문서 파싱은 그 글자가 문서 안에서 어떤 구조와 의미로 연결되어 있는지까지 함께 정리하는 단계입니다. 문단·표·이미지·병합 셀 구조를 분리하고, 계층 관계를 복원해 JSON·HTML·마크다운 같은 구조화 포맷으로 출력합니다.

문서 파싱이 단순 텍스트 추출 및 OCR과 다른 점 – 구조 보존

문서 파싱은 단순히 글자를 추출하는 것이 아니라, 텍스트가 문서 안에서 어떤 구조와 관계로 연결되어 있는지까지 함께 분석해 구조화 데이터로 변환하는 과정입니다. 반면 단순 텍스트 추출은 디지털 문서에서 문자열만 가져오는 방식이고, OCR(Optical Character Recognition, 광학 문자 인식)은 이미지나 스캔 문서 속 글자를 인식하는 기술입니다. 

예를 들어 문서 파싱은 제목·본문·표·이미지·계층 구조까지 함께 구분해 JSON·HTML·마크다운 같은 형태로 정리하지만, 단순 텍스트 추출과 OCR은 글자 자체를 확보하는 단계에 더 가깝죠.

세 개념은 자주 혼용되지만, OCR과 텍스트 추출이 글자 자체를 확보하는 단계라면 문서 파싱은 그 글자가 어떤 구조에 속하는지까지 정리해 JSON·마크다운으로 내보낸다는 점이 결정적인 차이입니다.

문서 파싱·텍스트 추출·OCR 차이 비교표

구분목적인식 대상출력 포맷RAG 활용
문서 파싱구조·계층까지 분석제목·표·이미지·계층JSON·HTML·마크다운문맥·구조 정보 보존
단순 텍스트 추출문자열 추출디지털 문서 속 텍스트일반 텍스트빠르지만 구조 보존이 약함
OCR이미지 속 글자 인식스캔 문서·이미지 PDF텍스트, 위치 정보원문 텍스트 확보

문서 파싱은 단순히 글자를 추출하는 것이 아니라, 제목·표·계층 구조까지 함께 정리하는 과정입니다. 이렇게 구조가 정리된 데이터는 이후 검색·분석·AI 처리 단계에서도 더 안정적으로 활용할 수 있습니다.

문서 포맷마다 파싱 방식이 다른 이유

PDF·HWP·HWPX·OOXML은 모두 문서 파일이지만, 내부 저장 방식이 서로 다르기 때문에 같은 방식으로 처리하기 어렵습니다. 단순 텍스트 추출만으로는 문서 구조를 안정적으로 복원하기 어려워, 포맷마다 다른 문서 파싱 전략이 필요합니다.

예를 들어 PDF는 글자를 화면 어디에 배치할지만 좌표 형태로 저장하고, HWP는 압축된 바이너리 구조로 문서를 저장합니다. HWPX와 OOXML은 ZIP 안에 여러 XML 파일이 들어 있는 형태라, 문서 구조를 읽기 위해 ZIP 압축 해제와 XML 분석 과정이 함께 필요합니다.
이처럼 포맷마다 저장 구조가 다르기 때문에, 하나의 파서로 모든 문서를 동일하게 처리하기는 어렵죠.

PDF 포맷 – 표와 다단 레이아웃 구조

PDF는 글자가 어떤 순서로 읽혀야 하는지보다, 화면 어디에 표시되어야 하는지를 중심으로 저장되는 포맷입니다. 그래서 사람이 보기에는 정상적인 문서라도, 텍스트 추출 단계에서는 읽기 순서가 뒤섞이는 경우가 생길 수 있습니다.

특히 신문처럼 여러 단으로 구성된 문서나 복잡한 표가 포함된 PDF에서는 문제가 더 자주 발생합니다. 표 안의 숫자와 항목명이 서로 어긋나거나, 문장이 원래 순서와 다르게 추출되는 일도 자주 발생하죠.

그래서 PDF 문서는 단순 텍스트 추출보다 레이아웃과 좌표 구조까지 함께 분석하는 문서 파싱 과정이 중요합니다.

HWP·HWPX – 한국 공공 문서 파싱이 어려운 이유

AI가 공공문서를 읽을 때는 사람의 눈으로 읽는 것과 다른 방식으로 읽음을 표현하는 이미지

HWP는 본문·표·서식 정보를 함께 저장하는 압축된 바이너리 구조입니다. 문서 내용이 단순 텍스트 형태로 저장되는 것이 아니라 여러 구조 정보와 함께 압축되어 있기 때문에, 일반 텍스트 추출만으로는 문단·표·서식 관계를 안정적으로 해석하기 어렵습니다.

예를 들어 사람이 보기에는 하나의 표처럼 보이더라도, 실제 표·문단 정보가 함께 저장되어 있습니다. 그래서 단순 텍스트 추출만으로는 표 구조나 문단 계층이 원래 형태대로 복원되지 않을 수 있습니다.

HWPX는 HWP보다 구조가 공개된 XML 기반 포맷이지만, 본문·설정·메타데이터가 여러 XML 파일로 나뉘어 저장됩니다. 그래서 HWPX 역시 ZIP 압축 해제와 XML 구조 분석 과정을 함께 거쳐야 문서 의미를 안정적으로 복원할 수 있습니다.

2026년 행정안전부가 중앙·지자체 온나라시스템에서 HWP 첨부를 제한하고 HWPX 사용을 의무화하는 이유도 여기에 있습니다. 기존 HWP보다 기계가 문서 구조를 읽고 분석하기 쉬워 AI 활용에 유리하기 때문입니다. 

공공·교육·법무처럼 HWP 사용 비중이 높은 환경에서는 HWP·HWPX 문서 파싱이 AI 도입의 중요한 전처리 단계가 되고 있습니다.

OOXML(DOCX·XLSX·PPTX) – 복잡한 구조의 범용 포맷

OOXML은 DOCX·XLSX·PPTX 같은 오피스 문서에서 사용하는 개방형 포맷입니다. 겉으로는 하나의 문서 파일처럼 보이지만, 실제 내부는 ZIP 압축 파일 안에 여러 XML 문서와 이미지·설정 파일이 함께 들어 있는 구조로 구성됩니다.

하지만 같은 OOXML 계열이라도 DOCX·XLSX·PPTX는 내부 구조와 문서 구성 방식이 서로 다릅니다. 워드는 문단 흐름과 제목 계층 중심으로 구성되고, 엑셀은 셀·시트 관계와 표 구조가 중요합니다. 

PPTX는 각 슬라이드가 슬라이드 레이아웃과 슬라이드 마스터를 참조해 제목·본문이 들어갈 위치와 서식을 결정합니다. 쉽게 말해 슬라이드 하나의 모양은 마스터·레이아웃·슬라이드, 세 가지 XML 파일이 함께 만들어내는 구조예요. 세 파일을 함께 파싱해야 슬라이드 안의 텍스트와 객체가 어디에 어떻게 배치되어 있는지 문맥에 맞게 추출할 수 있습니다. 

그래서 병합 셀·다단 헤더·슬라이드 레이아웃 같은 복잡한 구조를 원본 그대로 보존하면서 추출하려면 단순 텍스트 추출만으로는 한계가 있습니다. 실제 문서 AI 환경에서도 DOCX·XLSX·PPTX는 각각 다른 방식으로 분석되는 경우가 많습니다.

특히 XLSX에서 자주 쓰이는 병합 셀은 파싱 과정에서 까다로운 문제 중 하나입니다. 병합된 셀의 값이 첫 번째 셀에만 저장되고 나머지 셀은 빈 값으로 처리되는 구조라, 단순 추출 시 어떤 셀이 어떤 범위에 걸쳐 있는지 관계 정보가 사라질 수 있습니다. RAG 청킹 단계에서 표 단위 분리가 필요할 때 이 관계 정보가 없으면 의미 있는 청크를 만들기 어렵습니다. 

이미지·표·비정형 문서 파싱 – OCR 선처리와 구조 복원이 모두 필요한 이유

PNG·JPG 같은 이미지 포맷은 텍스트 정보가 포함되어 있지 않기 때문에, 문서 안의 글자를 활용하려면 먼저 OCR 처리가 필요합니다. 또한 표 데이터나 차트가 이미지 형태로 저장된 경우에는 OCR 이후에도 셀 관계와 계층 구조를 별도로 복원해야 문맥을 안정적으로 유지할 수 있습니다.

예를 들어 OCR만으로 숫자와 글자를 읽어낼 수는 있어도, 어떤 숫자가 어떤 항목과 연결되는지까지 자동으로 이해하는 것은 또 다른 문제입니다. 그래서 이미지 기반 문서는 텍스트 추출 이후에도 레이아웃과 구조를 함께 분석하는 과정이 중요합니다.

문서 구조 손실이 데이터 활용에 미치는 영향

문서 파싱 단계에서 표 제목과 셀 데이터의 연결이 끊기거나 계층 구조가 사라지면, 이후 RAG 파이프라인 전반에 걸쳐 맥락 오류가 누적될 수 있습니다. 수치는 남아 있어도 어떤 항목을 설명하는 값인지 알기 어렵고, 서로 다른 섹션의 내용이 뒤섞여 검색 단계에서 관련 없는 문서가 반환되거나 답변의 근거가 흔들릴 수 있습니다. 파싱 품질은 청킹·임베딩·벡터DB 저장·검색·답변 생성으로 이어지는 RAG 파이프라인의 첫 번째 단계인 만큼, 원본 구조를 보존하는 문서 파싱 솔루션을 갖추는 것이 중요합니다.

RAG 파이프라인 구축 시 문서 전처리 부담과 정보 손실 문제가 걱정된다면, 한컴 데이터 로더로 한 번에 해결할 수 있습니다.

👉한컴 데이터 로더란? HWP·HWPX·PDF·OOXML 문서 파싱 솔루션

문서 파싱 솔루션 도입 전 체크리스트

문서 파싱 솔루션은 사내 문서 종류·보안 환경·후처리 흐름까지 함께 검토해야 RAG 도입 이후 정확도와 운영 안정성을 모두 확보할 수 있습니다.

지원 포맷 범위

HWP·HWPX·PDF·OOXML·이미지까지 변환 없이 원본에서 직접 추출하는지 확인하세요. 포맷 지원 범위가 좁으면 사내 문서 유형에 따라 별도 전처리가 추가로 필요해질 수 있습니다.

HWP·HWPX 원본 데이터 직접 추출 여부

PDF로 한 번 변환한 뒤 파싱하는 방식은 표가 이미지로 바뀌거나 문단 계층이 약해질 수 있습니다. 특히 HWP·HWPX를 PDF로 우회 변환하는 경우 원본의 글머리표·들여쓰기·서식 정보가 손실되기 쉬워요. 원본 파일을 직접 분석·추출하는 방식인지 확인하는 것이 중요합니다.

표 및 이미지 구조 보존 수준

병합 셀·테두리 없는 표·중첩 표까지 행·열 관계를 복원하는지 확인하세요. 셀 내용만 추출하는 방식은 셀 간 관계 정보가 사라져 RAG 청킹 단계에서 의미 있는 단위를 만들기 어렵습니다. 문서 구조 분석(DLA, Document Layout Analysis)과 표 구조 인식(TSR, Table Structure Recognition)이 함께 적용되는지 보는 것이 좋습니다.

보안 및 배포 환경

공공·금융·법무·의료 환경은 폐쇄망 운영이 일반적이라 온프레미스 지원 여부를 먼저 확인해야 합니다. 클라우드 기반 SaaS가 적합한 환경이라면 초기 비용 없이 빠르게 도입할 수 있는 방식인지 함께 검토하세요.

후보정·커스터마이징 가능 여부 

자동 추출만으로 정확도를 확보하기 어려운 문서가 있다면, 추출 결과를 검수하고 패턴을 학습시킬 수 있는 도구가 함께 제공되는지 확인하세요. 고객사 양식에 특화된 데이터를 구축하려면 라벨링·태깅 기능과 읽기 순서 수정 기능이 지원돼야 합니다. 

문서 파싱 솔루션, 한컴 데이터 로더로 실전 적용하기

한컴 데이터 로더 주요 기능 소개 이미지. HWP·HWPX 파싱, 문서 구조 분석, TSR 표 추출, 온프레미스 API 지원 기능

🖥️한컴 데이터 로더

문서 파싱 솔루션은 단순 텍스트 추출 기능만으로 판단하기 어렵습니다. 원본 문서 구조를 얼마나 유지할 수 있는지, 다양한 포맷을 안정적으로 처리할 수 있는지, 온프레미스 같은 보안 환경에서도 운영 가능한지를 함께 확인해야 합니다. 

한컴 데이터 로더는국내 유일하게 HWP·HWPX를 PDF 변환 과정 없이 원본 문서에서 직접 파싱해 구조와 의미 정보를 보존하며, PDF·OOXML·이미지까지 다양한 포맷을 처리합니다.

HWP·HWPX·PDF를 포함한 주요 문서 포맷에서 표·계층·이미지 구조를 보존한 구조화 데이터로 변환하고, 온프레미스 설치부터 데이터 로더 스튜디오를 통한 후보정까지 파싱 전 과정을 하나의 파이프라인으로 지원합니다. 

RAG 파이프라인 구축 시 문서 전처리 부담과 정보 손실 문제가 걱정된다면, 한컴 데이터 로더로 한 번에 해결할 수 있습니다. 에이전트가 신뢰할 수 있는 문서 전처리, 지금 바로 시작해 보세요.

💡 설치 없이 문서 파싱 솔루션을 바로 테스트해 보세요. 내 문서를 업로드하면 표·계층·레이아웃 구조까지 한눈에 확인할 수 있습니다.

👉 내 문서로 한컴 데이터 로더 체험해 보기

👉 한컴 데이터 로더, 도입 문의하기

문서 파싱 관련 자주 묻는 질문 FAQ

Q1. AI한테 문서 읽히려면 왜 파싱을 따로 해야 할까요?

AI는 문서를 단순 글자 모음이 아니라 구조와 문맥 단위로 이해해야 합니다. 하지만 PDF·HWP·HWPX 같은 문서를 그대로 입력하면 표·제목·계층 구조가 깨져 의미 관계가 손실될 수 있습니다. 문서 파싱은 제목·본문·표·이미지 구조를 정리해 AI가 문맥을 유지한 상태로 검색·답변할 수 있도록 만드는 전처리 과정입니다.

Q2. HWP·HWPX 파일을 RAG에 넣으려면 어떻게 변환해야 하나요?

HWP·HWPX는 압축 구조와 문단·표 계층 정보를 함께 저장하는 포맷이라 단순 텍스트 추출만으로는 원본 구조를 유지하기 어렵습니다. 특히 표·글머리표·문단 계층 정보는 일반 변환 과정에서 손실되는 경우가 많습니다. RAG에 활용하려면 원본 문서를 직접 파싱해 JSON·HTML·마크다운 같은 구조화 데이터로 변환하는 과정이 필요합니다.

Q3. 문서를 PDF로 변환하면 표 데이터가 날아가는 이유가 뭔가요?

PDF는 글자의 의미보다 화면 어디에 배치되는지를 좌표 중심으로 저장하는 포맷입니다. 그래서 단순 텍스트 추출만 진행하면 표의 행·열 관계나 읽기 순서가 쉽게 깨질 수 있습니다. 숫자 자체는 추출되더라도 어떤 항목에 연결된 값인지 관계 정보가 사라지면, AI가 문맥을 정확하게 이해하기 어려워질 수 있습니다.

 


참고 자료

1. arXiv, 「Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction」, 2024 

2. arXiv, 「PDF Parsing — Word order preservation 및 Table extraction」, 2024

3. Google Cloud, 「Agent Search 문서 파싱 및 청크 처리」, 2026 

4. AWS, 「검색 증강 생성(RAG)이란?」, 2026 

5. 한컴테크, 「한/글 문서 파일 형식: Python을 통한 HWPX 포맷 파싱하기 (1)」, 2024 

6. 한컴테크, 「한/글 문서 파일 형식: Python을 통한 HWP 포맷 파싱하기 (2)」, 2024 

7. ZDNet Korea, 「18일부터 공공문서 ‘HWPX’ 의무화…AI 친화형 행정 체계 전환」, 2026