工具推荐·阅读约 1 分钟·
Hister:一个自己掌控的私有全文搜索引擎,把你看过的网页变成可检索的知识库

Hister:一个自己掌控的私有全文搜索引擎,把你看过的网页变成可检索的知识库

书签只能找回标题,搜索引擎搜不到你记得的内容。Hister 把浏览器访问过的页面、本地文件和爬取的内容全文索引到你自己控制的服务器上,支持字段过滤、短语、通配符、MCP 接入,AGPLv3 开源。

原文来源:Hister — 一个 AGPLv3 开源、可自托管的私有全文搜索引擎:把你访问过的网页、本地文件和历史记录变成索引,搜索界面、终端、CLI 和 MCP 都能访问,数据只在你控制的服务器上。

一个困扰所有"收藏家"的经典问题:你明明看过一篇很有用的文章,三个月后想找回来,却只记得里面某个词。浏览器书签只能帮你找回标题,普通搜索引擎只索引公开网页——你自己的阅读历史、本地笔记、下载的资料,全都搜不到。Hister 就是冲着这个痛点来的:它把你选择的页面和文件全文索引,存在你自己控制的服务器上,随时可搜。

Hister 在 Hacker News 上获得了 459 分的高赞,是近期最受关注的自托管工具之一。它有两个鲜明的特点:全文内容索引(不是只存标题和 URL)和完全私有的部署模型(无遥测、无强制云服务)。

核心设计:收藏 → 索引 → 查找

Hister 的工作流是一个简单循环:

  1. 收集:浏览器扩展自动索引你访问过的页面;文件监视器盯着本地文件夹;历史导入和爬虫把其他来源汇入同一个索引。
  2. 索引:内容提取器从支持的格式和网站里抽出有效部分,全文索引到你配置的服务器上。
  3. 查找:Web 界面、终端客户端、CLI、HTTP API 甚至 MCP 服务器都能访问同一个索引——这意味着你可以让 AI 助手直接检索你的私人知识库。

从实际截图看,作者已经索引了 1,924 个页面,搜索"上个月读过的隐私笔记"只需 0.04 秒。

—— 广告 ——

隐私模型:为什么它和浏览器历史不一样

Hister 的隐私设计有几个关键决策:

  • 无遥测:服务器不向任何地方汇报,不报告你搜了什么。
  • 无强制云:一个完整的个人部署可以在单台本地机器上跑完。
  • 你选择的服务器:客户端只把索引内容发送给你配置的 Hister 服务器,别的什么都不会。
  • 可审计:源代码公开,AGPLv3 许可。

可选的分词语义搜索会把文本发送到你配置的 embeddings 端点,浏览器扩展可能获取页面 favicon——这两个都是你决定要不要开的开关,连接往哪走由你说了算。

检索能力:不止是关键词

Hister 的查询语言比一般全文搜索强不少:

  • 字段过滤:按字段缩小范围
  • 短语精确匹配:带引号的完整短语
  • 通配符和否定:灵活的模式匹配
  • 日期范围:限定时间窗口
  • 查询别名:给常用查询起名字

搜索结果旁边会打开一个干净的存储预览——原文内容已经随索引存了一份,所以即使原网页后来被删了、改版了或需要登录,你依然能看到当时的内容。索引规则支持跳过和优先级,版本跟踪可以保留文档的早期版本,还有敏感内容检查。

部署方式:从零配置到多用户

单个二进制即可本地运行,这是最轻的起步方式。想更进一步的话:

  • SQLite 或 PostgreSQL 后端
  • 多用户支持:共享服务器上按用户隔离访问
  • Docker 和 Nix 一键部署
  • 多种爬虫后端、语言感知索引、内容版本化、所有权规则、可配置提取器

为什么值得关注

Hister 解决的是"知识沉淀"这个真实问题:你每天浏览几十个页面,其中真正有价值的信息散落在历史记录和书签里,找不回来就等于没看过。把它变成自己的搜索索引后,等于给记忆建了个外置硬盘。

对独立开发者和技术写作者来说,它的 MCP 接入尤其有价值——AI 助手可以直接检索你的私人资料库,而不只是训练数据里的公开内容。配合自托管,数据和索引完全在自己手里,没有第三方搜索引擎厂商能看到你的搜索历史。

开源、免费、隐私优先,三样都占齐的工具不多。Hister 的官方 Demo 可以实时体验:demo.hister.org。想要"知识只进不出"的个人知识库,这是个值得花一个晚上部署的项目。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tools/hister-private-search-index