DLA(문서 구조 분석)란? RAG 전처리 품질과 검색 정확도를 결정하는 핵심 기술 정리
DLA(Document Layout Analysis, 문서 구조 분석)는 RAG(Retrieval-Augmented Generation, 검색 증강 생성) 시스템의 성패를 가르는 핵심 전처리 기술입니다.
사내 문서로 구축한 AI가 관련 없는 답을 내놓거나, 표에서 수치를 잘못 읽거나, 이미지 정보를 통째로 누락하는 문제의 원인은 대부분 대규모 언어 모델(LLM)이 아닙니다. 문서를 AI가 읽을 수 있는 구조로 변환하는 전처리 단계에서 이미 정보가 손실되기 때문입니다. 청킹 품질, 검색 정확도, 할루시네이션 발생률까지 DLA가 어떻게 결정하는지, 실무 관점에서 풀어 드리겠습니다.
DLA란 무엇일까요?
DLA는 텍스트만 추출하는 것이 아니라 문서 안의 제목, 본문, 표, 이미지, 캡션 등이 어떤 위치와 관계로 구성되어 있는지 분석하는 기술입니다. 즉, 책의 목차를 정리하듯 문서의 구조와 읽기 순서를 파악해 AI가 활용할 수 있는 형태로 정리하는 과정입니다.
DLA의 정의와 핵심 개념
DLA의 핵심은 문서를 단순한 글자 모음이 아니라 구조를 가진 정보 단위로 이해하는 데 있습니다. 같은 문장이나 숫자라도 제목에 있는지, 본문에 있는지, 표 안에 있는지에 따라 의미가 달라질 수 있기 때문입니다.
예를 들어 표의 숫자가 본문 텍스트와 뒤섞이면 AI는 그 숫자가 어떤 항목을 설명하는 값인지 구분하기 어렵습니다. 또 제목과 본문 계층이 사라지면 서로 다른 섹션의 내용이 섞여 검색 결과나 답변의 근거가 흔들릴 수 있습니다.
따라서 DLA는 제목·본문·표·이미지·캡션의 위계와 읽기 순서를 보존해 이후 청킹, 임베딩, 검색, 답변 생성 단계에서 문서의 의미가 유지되도록 돕는 핵심 전처리 과정입니다. 최근 문서 파싱 연구(Document Parsing Unveiled, 2024)에서도 비정형 문서를 기계가 읽을 수 있는 표현으로 바꾸는 파싱을 RAG 앞단의 중요한 전처리 단계로 설명하고 있습니다.
OCR과 DLA는 무엇이 다를까요?
OCR(Optical Character Recognition, 광학 문자 인식)은 이미지나 문서에서 글자를 인식해 텍스트로 변환하는 기술입니다. 반면 DLA는 인식된 텍스트가 문서 안에서 어떤 역할을 하는지, 제목인지 본문인지, 표 안의 데이터인지, 이미지 설명인지까지 구조적 맥락을 함께 분석하는 기술입니다.
예를 들어 OCR은 표 안의 숫자 ’95’를 읽을 수는 있지만, 그 숫자가 ‘2025년 매출’인지 ‘고객 만족도 점수’인지까지는 알기 어렵습니다. 반면 DLA는 해당 숫자가 어떤 표의 어떤 항목에 속하는지, 주변 제목과 본문은 무엇인지까지 함께 파악해 문서의 의미를 보존합니다.
OCR이 글자를 읽는 기술이라면, DLA는 문서의 구조와 관계를 이해하는 기술입니다. 텍스트만 추출하면 제목, 표, 목록의 구조가 평면화되어 문맥 정보가 손실될 수 있지만, DLA를 함께 적용하면 이후 청킹, 임베딩, 검색 단계에서도 문서의 의미를 보다 정확하게 유지할 수 있습니다. 이것이 RAG에서 OCR 단독 처리보다 DLA를 함께 사용하는 것이 검색 정확도에 유리한 이유입니다.
DLA가 RAG 검색 정확도를 결정하는 3가지 이유
문서 계층 구조 보존, 표 구조 복원, 비정형 데이터 정형화는 DLA의 핵심 역할입니다. 이러한 구조 정보는 이후 청킹, 임베딩, 검색 단계로 전달되어 RAG 시스템의 검색 품질을 결정합니다.
RAG 청킹 품질은 문서 계층 구조 보존에서 시작
계층 구조 청킹(Hierarchical Chunking)과 의미 단위 청킹(Semantic Chunking)이 제대로 작동하려면, 문서의 제목, 섹션, 본문 위계가 파싱 단계에서 먼저 보존되어 있어야 합니다. 계층 구조가 손실되면 서로 다른 주제의 내용이 하나의 청크로 묶이거나, 반대로 하나의 의미 단위가 여러 청크로 분리될 수 있습니다. 그 결과 검색 정확도가 떨어지고 답변 품질에도 영향을 미칠 수 있습니다.
의미 단위 청킹과 계층 구조 청킹은 모두 DLA 품질에 의존합니다. 문서의 제목, 본문, 표 구조가 정확하게 분석되어야 청킹 과정에서도 문맥과 의미가 유지될 수 있기 때문입니다. 실제 연구에서도 구조 인식을 강화한 RAG 시스템이 기존 시스템보다 더 높은 답변 정확도를 보였으며, 일부 연구에서는 약 47% 더 많은 질문에 정확하게 답변한 것으로 나타났습니다.
이 문제가 특히 두드러지는 영역이 한국어 공문서입니다. 법령, 보고서 특유의 들여쓰기 기반 위계 구조는 글로벌 범용 파서가 제대로 인식하지 못하는 경우가 많습니다. 한컴 데이터 로더가 문단 스타일, 들여쓰기, 번호 체계를 분석해 계층 레벨을 자동 태깅하는 Level 추론 엔진을 별도로 내재화한 것도 이 때문입니다.
TSR 복원이 수치 기반 질의 오류를 줄이는 이유
표가 평면 텍스트로 변환되는 순간 행·열 관계가 손실되고, RAG는 수치 질의에서 오답을 만들기 시작합니다.
단순 파싱으로는 병합 셀, 다단 헤더가 처리되지 않아 표 구조가 손실됩니다. AI가 잘못된 근거를 참조하고, 수치 기반 질의 오류가 급증하는 원인이 여기서 시작됩니다. 재무 보고서, 기술 문서의 표가 RAG의 대표적 실패 지점으로 꼽히는 이유이기도 합니다.
TSR(Table Structure Recognition, 표 구조 인식)은 이 문제를 해결하는 핵심 기술입니다. 한컴 데이터 로더는 테두리 없는 표, 병합 셀, 표 안의 표(중첩 표)까지 인식하고, 셀 단위 행·열을 마크다운으로 변환합니다.
이미지·차트 정보를 RAG 검색에서 살리려면 무엇이 필요할까요?
이미지와 차트는 텍스트 추출만으로 RAG 검색 대상이 될 수 없습니다. 맥락 정보가 없으면 AI는 시각 정보를 존재하지 않는 것으로 처리합니다.
단순 파싱으로는 이미지, 차트 정보가 검색 대상에서 제외됩니다. 이미지 맥락 키워드 추출이 함께 이루어져야 비로소 AI 답변 품질이 완성됩니다. 이미지 캡셔닝(Image Captioning)과 맥락 키워드 추출이 답변 품질의 완성도를 결정하는 이유입니다.
한컴 데이터 로더는 DLA 기반으로 이미지, 차트를 문서 내 별도 객체로 인식하고 분리 저장합니다. 이미지 속 객체의 맥락과 관계를 이해해 자연어 캡션을 생성하는 이미지 캡셔닝 기능은 현재 PoC 단계로, 상용 출시 일정은 추후 안내될 예정입니다.
💡HWP·HWPX부터 PDF, 이미지까지, 변환 없이 원본 그대로 RAG 파이프라인에 연결하고 싶다면?
텍스트 추출과 DLA, 무엇이 다를까요?
단순 텍스트 추출은 문자만 가져오고, DLA 그 문자가 문서 안에서 갖는 역할, 위치, 관계까지 함께 보존합니다. 이러한 구조 정보의 보존 여부가 검색 정확도와 답변 품질을 결정하는 중요한 차이점입니다.
단순 텍스트 추출 vs DLA
| 비교 항목 | 단순 텍스트 추출 | DLA |
| 표 처리 | 행·열 관계 손실 | 병합 셀까지 복원 |
| 문단 위계 | 평면 텍스트 | 제목·본문·목록 계층 보존 |
| 이미지·차트 | 무시 또는 누락 | 객체 인식·분리 저장 |
| Chunk 품질 | 의미 단위 깨짐 | 계층 기반 분할 가능 |
| RAG 검색 정확도 | 낮음 | 높음 |
| 할루시네이션 | 잦음 | 최소화 |
DLA를 적용한 RAG 시스템은 미적용 시스템 대비 텍스트 기반 질의 응답 정확도는 최대 9.0%, 이미지·차트 등 시각 정보를 활용한 질의 응답 정확도는 최대 6.4% 향상되는 것으로 SCAN 연구(Findings of ACL: EACL 2026)에 보고되었습니다.
한컴 데이터 로더는 HWP·HWPX, PDF, OOXML을 구조화 데이터로 전환하는 문서 파싱 솔루션입니다. 시맨틱스(Semantix)는 DLA, OCR, TSR, 이미지 캡셔닝을 단일 파이프라인으로 통합한 기술이며, 한컴 데이터 로더는 이 시맨틱스를 내부에 포함하는 솔루션입니다.
RAG 할루시네이션은 왜 발생하나요?
RAG 할루시네이션(RAG Hallucination)의 대부분은 대규모 언어 모델(LLM) 성능 문제가 아니라, 문서 전처리 단계에서 정보가 손실된 채로 파이프라인에 진입하면서 시작됩니다.
할루시네이션을 줄이는 문서 구조 유지
파서(Parser) 단계에서 정보가 손실되면 잘못된 청크와 검색 결과가 생성되고, 이를 바탕으로 답변을 만드는 과정에서 할루시네이션이 발생할 수 있습니다. 잘못된 청크가 만들어지면 검색 단계에서 관련 없는 근거를 가져오고, 그 위에서 정교한 오답이 생성됩니다. 모델을 바꿔도 잘못된 입력을 더 정교하게 재구성할 뿐이라 실제 원인을 발견하기가 오히려 어려워집니다.
반면 문서 구조가 보존될수록 AI는 정확한 의미 단위를 검색하고, 관련 없는 정보를 근거로 삼는 오류가 줄어듭니다. 구조 보존 파싱 → 정확한 청킹 → 정확한 검색 → 할루시네이션 최소화, 이 흐름이 핵심입니다.
기업의 문서 AI 활용을 위한 DLA 솔루션 선택 기준
기업 환경에 맞는 문서 파싱 솔루션을 선택할 때는 HWP·HWPX 원본 파싱 가능 여부, 온프레미스 구동 지원, JSON·HTML 구조화 출력, 망 분리 환경 대응, 이 네 가지를 반드시 확인해야 합니다.
HWP·HWPX를 포함한 국내 주요 문서 포맷을 원본 그대로 처리할 수 있어야 하고, PDF 변환 없이 원본 파일에서 직접 추출하는 방식으로 구조 손실을 최소화해야 합니다.
공공·금융 기관이라면 내부망·망 분리 환경에서 외부 전송 없이 온프레미스로 구동되는 방식인지를 반드시 확인해야 합니다. 여기에 추출 결과가 JSON·HTML 형식으로 출력되어 RAG 파이프라인과 바로 연결 가능한지도 빠뜨릴 수 없습니다.
한컴 데이터 로더는 HWP·HWPX 원본 파싱, 온프레미스 완전 내재화, JSON·HTML 구조화 출력, 망 분리 환경 대응을 모두 충족하는 문서 파싱 솔루션입니다.
한국 기업 RAG에 글로벌 파싱 솔루션이 맞지 않는 이유
DLA가 RAG 품질을 좌우한다는 점은 잘 알려져 있습니다. 하지만 한국 기업 환경에서는 글로벌 범용 솔루션만으로 해결하기 어려운 다음과 같은 현실적인 제약이 존재합니다.
첫째, 글로벌 기업용 문서 파싱 API 대부분은 PDF, JPEG, PNG, TIFF 등 범용 포맷만 지원하며 HWP·HWPX 원본 직접 파싱은 지원하지 않습니다. HWP·HWPX를 PDF로 변환 후 처리하면 계층과 표 구조가 손실되어 RAG 품질이 떨어집니다.
둘째, 클라우드 API 방식은 공공·금융·법무 기관의 폐쇄망·망 분리 환경에서 원천적으로 사용할 수 없습니다.
셋째, 한국어 공문서 특유의 위계 구조는 글로벌 DLA 모델의 학습 범위 밖인 경우가 많습니다. 정부도 이러한 특성을 반영해 공공문서를 AI가 읽을 수 있는 HWPX 개방형 체계로 전환하고 있습니다. 중앙부처는 이미 2022년부터 온나라시스템에서 HWPX 사용이 의무화되어 있으며, 2026년 5월 18일부터는 지방자치단체 온나라시스템까지 동일 기준이 확대 적용됩니다.
한컴 데이터 로더는 HWP 원본 파싱, 온프레미스 보안, 한국어 문서 구조 인식에 관한 세 가지 조건을 모두 충족하는 솔루션입니다.
✅ HWP SDK 기반 HWP·HWPX 원본을 직접 파싱
✅ Docker REST API 온프레미스 문서 파싱을 완전 내재화
✅ 한국어 공문서 최적화 Level 추론 엔진 사용
✅ 한컴 데이터 로더 GS 인증 보유
정확한 HWP·HWPX 원본 파싱이 필요하다면 한컴 데이터 로더로 시작해 보십시오.
DLA 자주 묻는 질문
HWP·HWPX 파일을 RAG 파이프라인에 바로 활용할 수 있나요?
LangChain, LlamaIndex 등 범용 프레임워크는 HWP·HWPX 포맷을 기본 지원하지 않습니다. PDF로 변환 후 처리하면 구조가 손실되므로, HWP SDK 기반 원본 파싱을 지원하는 솔루션이 필요합니다. 한컴 데이터 로더는 REST API를 제공해 외부 RAG 프레임워크와 연동 가능하며, HWP·HWPX 원본 구조를 보존한 JSON 출력으로 RAG 파이프라인에 바로 연결할 수 있습니다.
DLA 없이 RAG를 구축하면 어떤 문제가 생기나요?
DLA 없이 RAG를 구축하면 텍스트가 평면화되어 제목·표·이미지 계층이 모두 손실됩니다. 청크가 의미 단위 없이 잘라지고, 검색 단계에서 관련 없는 근거를 가져오면서 할루시네이션이 급증합니다. 특히 표 데이터는 행·열 관계가 손실된 채 숫자만 나열되어 수치 기반 질의에서 오답률이 높아집니다. LLM을 교체해도 전처리 품질이 낮으면 동일한 오류가 반복되며, 원인을 찾기가 더 어려워집니다.
망 분리·폐쇄망 환경에서도 문서 구조 분석 솔루션을 도입할 수 있나요?
클라우드 API 방식의 파싱 솔루션은 공공·금융·법무 기관의 폐쇄망·망 분리 환경에서 원천적으로 사용할 수 없습니다. 온프레미스 문서 파싱을 지원하는 솔루션이 필요하며, 한컴 데이터 로더는 Docker REST API 형태로 고객사 내부 서버에 완전 내재화해 외부 네트워크 없이 운용이 가능합니다. 공공기관 및 금융사의 망 분리 환경에 최적화된 구조로, GS 인증을 보유해 공공 조달 환경에서도 도입이 검증되어 있습니다.
참고자료
- Lewis et al., 「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」, NeurIPS 2020
- Lin, 「Revolutionizing RAG with Enhanced PDF Structure Recognition」, arXiv:2401.12599
- Zhang et al., 「Document Parsing Unveiled: Techniques, Challenges, and Prospects」, arXiv:2410.21169
- Ueda et al., 「SCAN: Semantic Document Layout Analysis for Textual and Visual Retrieval-Augmented Generation」, Findings of ACL: EACL 2026
- AWS, 「검색 증강 생성(RAG)이란 무엇인가요?」
- IBM, 「RAG, 검색 증강 생성이란 무엇인가요?」
- AWS Textract 지원 문서 포맷
- Azure Document Intelligence 지원 포맷
- Google Document AI 지원 파일 형식
- 단비뉴스, 「한글 문서는 AI가 못 읽는다?」, 2026.02.01
- 연합뉴스, 「공공문서 HWPX 전환 의무화」, 2026.04.23