Skip to content

[Fix] PDF 텍스트 추출 시 깨진 문자(�) 검증 누락 #257

Description

@Gimini-3

📌 Description

PDF 파싱(PdfDocumentParser)은 암호화·빈 문서·OCR 필요·파싱 실패만 구분하고, 폰트 인코딩이 깨져 추출된 텍스트에 대체 문자(�)가 섞여 나오는 경우는 걸러내지 않는다. 손상된 텍스트가 검증 없이 Chunk·Embedding·RAG 검색까지 그대로 전달된다.

✅ To-do

  • ErrorCode.DOCUMENT_CONTENT_GARBLED 추가
  • PdfDocumentParser에서 추출 Segment 전체 대비 비율이 임계치를 넘으면 차단
  • WorkerIndexingFailureClassifier의 기존 DOCUMENT_CONTENT_INVALID 분류에 등록
  • 단위 테스트 추가 (PdfDocumentParserTest, WorkerIndexingFailureClassifierTest)

📒 기타

스코프 제외: 실제 손상 PDF 파일을 활용한 통합 재현 테스트 (재현 가능한 실제 파일 확보 시 후속 작업)

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions