← 返回项目库

PDF 秒级拆解引擎|本地 Markdown 提取

面向原生文本 PDF 的中文本地解析与 Markdown 提取工具,提供浏览器 WebAssembly 演示和 Node.js、Python、Rust、命令行接入。

pdf-inspector 是一个基于 Rust 的开源 PDF 解析引擎,能够识别文档类型、分析阅读顺序与表格结构,并输出保留位置语义的 Markdown。本交付保留上游 Rust 核心与多语言绑定,新增中文产品页、浏览器本地 WASM 运行链路、可重复的演示文档入口和明确的本地预览边界。

真实界面

项目截图

共 6 张

PDF 结构
交互演示
核心能力
处理架构
基准对比
接入方式

Capabilities

核心功能

原生文本、扫描件、图像型与混合 PDF 分类
基于坐标文本的多栏阅读顺序重建
矩形、线网格与对齐启发式表格结构提取
ToUnicode CMap、CID 与 Type0 字体解码
标题、列表、表格、链接与分页标记的语义化 Markdown 输出
npm、PyPI、crates.io 与内置命令行接入
浏览器本地 Rust/WASM 解析与 Markdown 复制
中文产品页、演示文档和本地预览范围披露

适用场景

在浏览器中快速检查原生文本 PDF 的分类与 Markdown 输出
为报告、论文、财务文档和发票建立本地解析流水线
在接入 OCR、云端 API 或知识库前验证 PDF 结构化处理能力

适合谁

需要在本地或自托管环境中解析报告、论文、财务文档、发票与法律 PDF 的开发者、小型团队和技术研究者。

商业化思路

MIT 开源源码交付与定制集成服务;真实 OCR、云端上传、批量处理和生产运维需由使用者自行配置并评估成本、隐私和合规要求。

你会拿到什么

  • 上游 pdf-inspector Rust 源码、Node.js/Python/Rust 绑定与 MIT LICENSE
  • 中文静态产品页、本地 WASM 产物、演示文档入口与离线运行说明
  • 构建、真实浏览器功能验证、6 张 UI 截图、源码包和生产审计证据

部署流程

  1. 1使用 Python 3 的静态服务器从 repo/site 启动预览,或将 site 目录部署到任意静态托管服务
  2. 2访问首页并点击“加载演示文档”,也可拖入不超过 25 MB 的原生文本 PDF 进行本地解析
  3. 3需要服务端或批量接入时,按仓库文档安装 Node.js、Python、Rust 或命令行绑定,并自行配置权限、OCR 与存储边界

真实验证结果

已通过 cargo fmt、cargo test(945 个库测试、162 个集成测试及文档测试)、cargo clippy -- -D warnings、cargo build --release、wasm-pack WASM 构建、真实浏览器点击解析、6 张 1440×900 中文截图、无错误/坏图/横向溢出检查和源码包门禁。

部署前须知

浏览器演示主要面向原生文本 PDF;扫描件与 OCR 服务未接入。WASM 产物与解析文件均在浏览器本地处理,演示不上传文件,也不连接云端 OCR、数据库或外部 API。

部署难度

简单

最低配置

浏览器演示只需要现代浏览器与一个静态文件服务器;Rust、Node.js、Python 和命令行接入请按仓库文档准备对应工具链。演示不依赖数据库或外部 API。

开源许可证

MIT

最后验证

2026-09-02

授权说明

仓库包含 MIT LICENSE。交付保留上游许可证、版权与来源信息,并披露本次中文产品页、浏览器本地 WASM 适配及 Rust 工具链兼容性清理;再分发请继续保留许可证与版权声明。

Release notes

版本记录

1 个已发布版本

vcn-843e3dbbddac 当前推荐

保留上游 Rust PDF 解析能力,新增中文产品页、本地 WASM 浏览器演示、可重复演示文档入口、离线资源路径和本地预览边界说明;补齐当前 Rust 工具链下的 lint 兼容性。

部署要求:浏览器演示需要现代浏览器与静态文件服务器;源码构建和 Node.js、Python、Rust、命令行接入请按仓库文档准备对应工具链。

已知问题:演示仅验证本地原生文本 PDF 解析;未接入 OCR、云端上传、数据库或外部 API,扫描件和生产批处理需另行集成。

登录后领取