You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
PDF 파싱(PdfDocumentParser)은 암호화·빈 문서·OCR 필요·파싱 실패만 구분하고, 폰트 인코딩이 깨져 추출된 텍스트에 대체 문자(�)가 섞여 나오는 경우는 걸러내지 않는다. 손상된 텍스트가 검증 없이 Chunk·Embedding·RAG 검색까지 그대로 전달된다.
✅ To-do
ErrorCode.DOCUMENT_CONTENT_GARBLED 추가
PdfDocumentParser에서 추출 Segment 전체 대비 � 비율이 임계치를 넘으면 차단
WorkerIndexingFailureClassifier의 기존 DOCUMENT_CONTENT_INVALID 분류에 등록
단위 테스트 추가 (PdfDocumentParserTest, WorkerIndexingFailureClassifierTest)
📒 기타
스코프 제외: 실제 손상 PDF 파일을 활용한 통합 재현 테스트 (재현 가능한 실제 파일 확보 시 후속 작업)
📌 Description
PDF 파싱(
PdfDocumentParser)은 암호화·빈 문서·OCR 필요·파싱 실패만 구분하고, 폰트 인코딩이 깨져 추출된 텍스트에 대체 문자(�)가 섞여 나오는 경우는 걸러내지 않는다. 손상된 텍스트가 검증 없이 Chunk·Embedding·RAG 검색까지 그대로 전달된다.✅ To-do
ErrorCode.DOCUMENT_CONTENT_GARBLED추가PdfDocumentParser에서 추출 Segment 전체 대비�비율이 임계치를 넘으면 차단WorkerIndexingFailureClassifier의 기존DOCUMENT_CONTENT_INVALID분류에 등록PdfDocumentParserTest,WorkerIndexingFailureClassifierTest)📒 기타
스코프 제외: 실제 손상 PDF 파일을 활용한 통합 재현 테스트 (재현 가능한 실제 파일 확보 시 후속 작업)