bluewhale2025/parseai-document-processor
0
ParseAI - Document Processing and Analysis
ParseAI는 PDF 문서를 처리하고 분석하기 위한 강력한 도구입니다. 문서에서 텍스트를 추출하고, 요약하며, 벡터 검색을 통해 관련 문서를 찾을 수 있습니다.
🚀 주요 기능
- PDF 문서 업로드 및 텍스트 추출
- 문서 내용 요약
- 벡터 기반 문서 검색
- Gradio 기반의 사용자 친화적인 웹 인터페이스
🛠️ 기술 스택
- Backend: FastAPI
- Frontend: Gradio
- NLP: NLTK, Hugging Face Transformers
- Vector Store: Sentence Transformers
- Container: Docker
🚀 로컬에서 실행하기
사전 요구사항
- Docker 및 Docker Compose
- Python 3.9+
환경 변수 설정
.env 파일을 생성하고 다음 변수들을 설정하세요:
# Hugging Face Hub configuration
HUGGINGFACE_HUB_TOKEN=your_hf_token_here
# Application configuration
UPLOAD_FOLDER=/app/data/uploads
NLTK_DATA=/app/nltk_dataDocker를 사용한 실행
- Docker 이미지 빌드:
docker build -t parseai .- 컨테이너 실행:
docker run -d -p 7860:7860 --env-file .env parseai- 웹 브라우저에서 접속:
http://localhost:7860🌐 Hugging Face Spaces에 배포하기
- 이 저장소를 Hugging Face Spaces에 푸시합니다.
- 저장소 설정에서 다음 환경 변수를 설정하세요:
HUGGINGFACE_HUB_TOKEN: Hugging Face API 토큰UPLOAD_FOLDER:/app/data/uploadsNLTK_DATA:/app/nltk_data
📝 사용 방법
- 문서 업로드 탭에서 PDF 파일을 업로드하세요.
- 문서 검색 탭에서 키워드를 입력하여 관련 문서를 검색하세요.
📊 상태 확인
애플리케이션 상태는 다음 엔드포인트에서 확인할 수 있습니다:
GET /health📄 라이선스
이 프로젝트는 MIT 라이선스 하에 배포됩니다.
