Skip to content
← 返回全部工具

Paperless-ngx

免费

把纸质文件扫进去,之后靠搜索找,不用再翻抽屉

开源 无广告 无追踪 跨平台 可自建

自建的文档管理系统。扫描或拍照上传纸质文件后,自动做 OCR 识别文字、推断文档类型和日期、按规则打标签归档,之后可以全文搜索任意一份文件的内容。合同、发票、保单、说明书、证件都能这样管。

为什么推荐它

每个家庭都有一个装满纸的抽屉:合同、保单、发票、 维修记录、说明书、各种证件复印件。需要找某一份的时候, 你知道它"应该在那里",但要翻二十分钟。

Paperless-ngx 解决的就是这件事。44,255 颗星,GPL-3.0, 是这个领域最成熟的开源方案。

工作流程很简单:

  1. 丢进去。用扫描仪、手机拍照,或者直接把电子版 PDF 放进监控目录。
  2. 它自动处理。OCR 识别文字(支持中文等多语言)、 从内容里推断日期、识别是哪个机构开的、按你设的规则自动打标签和分类。
  3. 之后靠搜索找。输入"2024 保险"或者合同里的某个词, 它在所有文档的全文里搜,秒出结果。

关键能力:

  • OCR 让扫描件变成可搜索的。这是核心价值—— 一张扫描的图片本来是搜不到内容的,OCR 之后每个字都能被找到。 它输出的是带文本层的 PDF,用任何阅读器打开都能选中文字。
  • 自动分类规则。可以设"标题含'电费'的自动归到'水电'标签、 通信人设为供电局",之后同类文件进来自动归位,不用手工整理。
  • 保留原件。它不修改你的原始文件,OCR 结果是附加的。
  • 全文搜索支持模糊匹配和高级查询。
  • 移动端友好的网页界面,手机拍照直接上传。

要说清楚的:

  • 需要部署,且不算轻。官方推荐 Docker Compose, 组件包括数据库、Redis、OCR 引擎和 Web 服务。 文档写得很详细,但需要一点自建经验
  • OCR 吃 CPU。批量导入几百份文档时会跑很久, 树莓派能跑但会慢,有条件的话给它一台性能好点的机器。
  • 中文 OCR 需要装对应语言包,默认可能只装了英文。 配置里指定语言,识别质量会好很多。
  • 它管的是"文档"不是"文件"。适合合同发票这类需要长期归档检索的东西, 不适合当通用网盘用(那是 Nextcloud 的活)。
  • 备份极其重要。你把纸质原件扔掉之后,这个系统就是唯一的副本了。 在开始大规模扫描之前,先把备份方案配好—— 至少一份异地或离线副本。

适合谁:想把家里的纸质档案数字化的人、 需要长期保存业务凭证的自由职业者和小公司、 以及任何受够了"我知道我有这份文件但找不到"的人。