原公众号文章:阅读原文;正文采集于 2026-09-22,原始发布时间未查到。
起因:一个工具停了
我一直在用一个叫 Elmo.chat 的浏览器扩展。 它很干净,打开网页侧边栏一点就能总结页面内容,没有广告,没有登录,没有会员。用了大半年,已经成了我浏览网页时的默认动作。 然后它停了。 我去试了一圈替代品。有的要注册账号,有的要绑信用卡,有的免费版每天只能用 5 次,有的界面塞满了升级按钮。最离谱的一个,打开侧边栏先弹 3 秒广告。 我只是想在浏览网页的时候,让 AI 帮我总结一下内容而已。
问题不是“没有 AI 工具”
说实话,我手头不缺 AI 工具。 我用 Hermes Agent 很久了。飞书里用它处理消息和任务,终端里用它写代码、跑脚本、管理项目。我甚至基于它搭了一套内容生产系统——选题发现、素材检索、文案创作、数据复盘,整个链路都跑通了。 但浏览器这个入口,一直是断的。 浏览网页的时候,看到一篇好文章想让它帮我记录下来,得先复制 URL,切到终端,粘贴进去,等回复,再把结果存到某个地方。这个流程太重了,重到我经常“算了,下次再说”。 我真正想要的不是又一个“AI 总结插件”。我想要的是 把已经在用的 Agent 带进浏览器 。飞书和终端里都跑顺了,就差这个入口。
于是我自己做了一个
Hermes Browser Bridge —— 一个 Chrome 侧边栏扩展,连接本地的 Hermes Agent。 核心就一件事:浏览任何网页时,侧边栏一键唤起 Agent 对话。 但做的过程中,发现要解决的问题比预想的多。
原文配图未包含在本次抓取样本中。
站点感知
普通的内容提取,就是把网页 HTML 一股脑扔给 AI。但 Twitter 的推文、小红书的图文笔记、GitHub 的 README、YouTube 的视频信息,这些页面结构完全不同,通用提取效果很差。 所以我针对 6 个常用站点写了专用提取器:
-
Twitter / X → 提取推文内容和互动数据
-
小红书 → 提取图文笔记
-
GitHub → 提取 README 和 Issues
-
YouTube → 提取视频信息
-
Hacker News → 提取讨论和评论
-
公众号 → 提取文章正文
其他页面用 Mozilla 的 Readability 做通用提取。不是简单抓 HTML,而是真正理解页面结构。
多轮对话
一次总结不够用。很多时候我想追问:“这个方案跟 X 比怎么样?”“帮我把这段整理成笔记格式。”“记下来,下次写文章可以用。” 所以对话必须带上下文,而且会话要自动保存。关掉浏览器再打开,之前的对话还在。
流式输出
等 AI 一个字一个字蹦出来,体验很差。通过 SSE 实现流式渲染,打字机效果,边生成边显示。
原文配图未包含在本次抓取样本中。
技术架构
整体分三层:
Chrome 扩展(WXT + React 19) ↕ HTTP Python Bridge 服务(aiohttp, 127.0.0.1:9118) ↕ 进程通信 Hermes Agent(Session Daemon 持久化) 扩展负责 UI 和内容提取,Bridge 负责和 Agent 通信,Agent 负责思考和回答。 Bridge 跑在本地,Token 自动配置,不需要任何云服务。你的数据从头到尾都在你的机器上。 安装就一行命令:
./scripts/setup.sh 环境检查、依赖安装、扩展构建、Bridge 启动,全自动化。
为什么开源
做这个扩展的过程中,我反复在想一个问题: 本地 AI Agent 的价值到底是什么? 答案是“随时可用”。 如果用本地 Agent 比打开 ChatGPT 网页还麻烦,那本地部署的意义就少了一半。浏览器是每个人每天用得最久的地方,如果 Agent 进不来,它就永远是个“专门打开才能用”的工具。 我希望 Hermes Agent 成为浏览器的一部分。看到一篇文章,侧边栏一点就能对话;浏览一个 GitHub 项目,直接问 Agent 这个项目值不值得用;刷到一条有意思的推文,让它帮我记下来,下次写文章的时候直接调出来。 这不是什么颠覆性的功能,但它让 AI Agent 从“需要专门打开的工具”变成了“随时在身边的助手”。 所以开源了。MIT 协议,Chrome 和 Firefox 都支持。 如果你也在用 Hermes Agent,可以试试看: GitHub : github.com/hjweix/hermes-browser-bridge