# NexaPDF **Repository Path**: asurd/nexa-pdf ## Basic Information - **Project Name**: NexaPDF - **Description**: NexaPDF —— 基于NLP的智能文档检索助手 - **Primary Language**: Python - **License**: MIT - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 2 - **Forks**: 2 - **Created**: 2025-12-02 - **Last Updated**: 2026-01-14 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # NexaPDF **智能文档解析与检索助手** ![licence](https://img.shields.io/badge/licence-MIT-73ff00?style=flat) ![version](https://img.shields.io/badge/version-v1.0-11ff00?style=flat) *** ### 软件架构 NexaPDF 是一个基于**Python**的智能文档解析与语义检索系统,支持 PDF / DOCX / PPTX / TXT 等格式文档的解析、索引构建与搜索。 系统由三个核心模块组成: 模块 1:文档解析(Document Parser) 模块 2:索引构建(Index Builder: TF-IDF + BM25 + 倒排索引) 模块 3:查询检索(Search Engine) 项目旨在实现一个完整的“文档 → 分析 → 检索”流程,可用于信息提取、文档管理、知识库系统等应用 ### 具体功能 #### 模块一 通过python的拓展库函数进行不同文件类型的解析,主要是章节标题和章节内容的划分,并把结果存入一个大的dict当中,提供给模块二进行索引构建 #### 模块二 构建倒排索引和BM25等各种评分来对文档内容进行精确地定位 #### 模块三 通过模块二的文本评分来精确锁定用户询问的内容,并进行简单的高亮显示和输出 ### 使用教程 1. 把仓库内容克隆到本地 2. 在目录下 pip install -r requirements.txt 安装依赖 3. 运行 run.py ### 参与贡献 1. Fork本仓库 2. 新建自己的分支 3. 提交代码 4. 新建Pull Request