바이브코딩

PDF Summary: 스캔한 PDF 도서 자동 요약 및 서평 생성 프로그램

ethanjoh 2026. 9. 1. 00:02

 

1. 개발 배경

서재 공간을 확보하기 위해 소장 중이던 종이책을 북스캐너(ScanSnap)로 직접 스캔하여 PDF로 보관해 왔습니다. 그러나 시간이 지나면서 각 도서의 주요 내용이 기억나지 않는 문제가 발생했습니다.

이러한 문제를 해결하고자, 대량의 PDF 도서를 자동으로 분석·요약하고 고품질 서평 마크다운 문서로 만들어 주는 PDF Summary 프로그램을 개발하게 되었습니다.


2. 주요 기능 및 특징

📂 폴더 일괄 처리 & 스마트 스킵

  • 지정된 폴더 내 모든 PDF 파일을 순차적으로 자동 탐색 및 분석합니다.
  • 이미 마크다운 리뷰 생성이 완료된 도서는 자동으로 건너뛰어(Skip), 중단 후 재실행 시 불필요한 API 호출을 방지합니다.

📚 시리즈 도서 자동 그룹화 및 통합 서평

  • 1권, 2권, 3권, (1), (2), _01, _02, 상/중/하, Vol.1, Vol.2 등의 파일명 패턴을 자동 인식합니다.
  • 시리즈 도서의 경우 첫 번째 권(1권)에서만 대표 북커버 이미지를 추출하고, 전체 내용을 종합 분석하여 단 하나의 완성형 통합 서평 문서로 요약합니다.

🛡️ API 할당량(Quota) 보호 및 스마트 폴백

  • 일일 무료 한도 대응: 기본 모델(gemini-3.7-flash) 일일 한도 소진 시 gemini-3.6-flash로 자동 전환되어 작업이 끊김 없이 이어집니다.
  • RPM/TPM 초과 제어: API 응답 메시지의 대기 시간을 파싱하여 적정 시간 쿨다운 후 자동 재시도합니다(최대 5회).
  • 미지원 모델 자동 감지: 서비스가 종료된 모델이 감지되면 즉시 사용 가능한 대체 모델로 전환합니다.

📄 대용량 PDF 분할 요약

  • 단일 파일 기준 약 100만 토큰(1,048,576 tokens) 초과 에러(400 INVALID_ARGUMENT) 발생 시, PyMuPDF를 통해 페이지 기준으로 3등분 자동 분할합니다.
  • 파트별 핵심 요약 후 최종 프롬프트를 결합하여 내용 누락 없는 종합 서평을 생성합니다.

🖼️ 고해상도 북커버 추출 & 링크 안정화

  • 1페이지를 200 DPI 고해상도 경량 JPG 파일로 추출·저장합니다.
  • 도서명 공백을 언더스코어(_)로 치환한 파일명({도서명_공백제거}_cover.jpg)을 부여하여 마크다운 뷰어 및 웹 플랫폼에서 이미지 링크 깨짐을 방지합니다.

🎭 장르별 맞춤 요약 및 Mermaid 시각화

  • 문학/소설: 결말과 반전 스포일러를 배제한 예고편 스타일 서평 + 인물 관계도 (Mermaid 다이어그램)
  • 비문학/실용서: 핵심 통찰, 프레임워크, 실사례 중심 서평 + 개념 체계도 (Mermaid 다이어그램)

🌐 SEO & AEO 최적화 구조

  • SEO: 메타 타이틀(30~50자), 메타 디스크립션(80~150자), 추천 태그 및 체계적인 헤딩(H1~H3) 구성
  • AEO (AI 답변 최적화): AI 검색 엔진(ChatGPT Search, Perplexity, Google AI Overviews) 인용을 위한 핵심 Q&A 섹션 포함
  • 티스토리, 네이버 블로그, 벨로그, 워드프레스, 노션 등에 바로 활용 가능

3. 프로그램 다운로드

프로그램 소스 코드 및 설치 방법은 GitHub 리포지토리에서 확인할 수 있습니다.


4. 유의사항

  • 텍스트 기반 PDF(OCR 필수): 텍스트 레이어가 포함된 PDF를 기준으로 작동합니다. OCR 처리가 되지 않은 이미지 형태의 PDF 요약이 필요할 경우 별도의 OCR API 연동 및 코드 수정이 필요합니다.
  • 티스토리 다이어그램 수정 주의: 티스토리 에디터에서 글을 수정한 뒤 재발행할 경우 Mermaid 다이어그램 태그가 누락될 수 있으므로, 최종 발행 전 다이어그램 코드가 유지되었는지 확인해야 합니다.

 

반응형

최근 댓글

Total

  • Today :
  • Yesterday :