本文速览 · 摘要 · 定义 · FAQ
TL;DR
- 大多数“信息获取系统”只是再造一条信息流:把 Hacker News、GitHub、论坛、Reddit 的内容抓回来按热度排好推给你。看着勤奋,实则是在手机里多养了一个自动化的时间黑洞。
- 换一个隐喻会换一套命运:不做信息流,做报箱。抓取器当沉默的邮差只管投递,AI 当有证据的读报人只讲变化,人只在需要时打开报箱——从争夺注意力,转向供给判断。
- 这套系统真正的分水岭不在“能抓多少源”,而在故障时是否诚实:失败绝不能返回一个整齐的“0 条新闻”。没有新闻,和没拿到新闻,是两回事。
- 可迁移的骨架只有四层:来源负责发生,抓取负责保存,AI 负责解释,人负责判断。好的 AI 系统不该把世界压成一个漂亮答案,而该让人保有回到事实、重新提问、改变判断的能力。
Definition
私人情报报箱(personal intelligence inbox),指把自动抓取、按日封存、AI 解读和人工判断分成四层的个人信息系统。它不追求实时推送与信息总量,而追求可回放:每一条结论都能回到原始来源,每一次抓取失败都作为状态被保存,而不是在界面上被抹平成“今天没有新闻”。与“信息流”相对——信息流是发散(越看越多),报箱是收敛(只在需要时,找到变化)。
FAQ
信息流和报箱,差别只是交互方式吗?
不是。它决定了一套系统究竟在争夺你的注意力,还是在保存你的注意力。信息流按到达时间实时打断你,逼你即时反应;报箱按日沉淀、等你来读,把“何时消费信息”的主动权交还给人。同样的来源,一个把你卷进洪流,一个替你守住判断。
为什么强调“抓取失败不能返回 0 条”?
因为“没有新闻”和“没拿到新闻”会导向完全相反的行动。前者说明世界安静,可以放心;后者说明系统瞎了,必须重抓。若两者都渲染成整齐的 0,你会把一次网络故障误读成天下太平。成熟系统的价值,往往不体现在一切正常时,而体现在它出错时是否诚实。
为什么不干脆让 AI 全自动读完、筛好、下结论?
技术上当然可以,但“可以”不是“应该”。个人信息系统最容易犯的错,就是把人最后的判断权也外包出去——你会得到一个每天替你判断一百件事的勤奋助手,却发现自己并没有长出更稳的认知框架,只是换了个更高效的刷屏入口。刻意保留“要你来读、要回到原文、要由人追问”这三分摩擦,是为了让信息为人所用,而不是让人活在信息里。
References and Further Reading
- 公开来源与开放 API:Hacker News、GitHub Trending/Releases、技术论坛 RSS、SEC EDGAR 一手披露、链上数据接口。
- 系统设计概念:幂等抓取与去重、来源健康度与优雅降级、一手/二手证据分级、按主题聚合而非按来源罗列。
- 本站同类主题:命令行里的 AI 长期记忆架构、7×24 自动化监控、RAG 检索与可审计系统设计。
01 · 先厘清病灶:不是新闻太少,是解释太贵
大多数人做“信息获取系统”,第一反应都是再造一条信息流:接上 Hacker News、GitHub、X、Reddit、论坛、RSS,把内容抓回来,按热度排好,再推给你。看起来很勤奋,实际上只是在手机里再养了一个更自动化的时间黑洞。
我们要讲的这套系统,从一开始想做的就不是这个。
它更像一座报箱。每天早晨,程序安静地把技术世界投递进来;真正需要阅读时,人再去打开报箱,由 AI 充当读报人,把值得注意的变化、它们背后的脉络、以及与你有什么关系讲清楚。抓取器不负责观点,读报人不假装全知,用户也不必在每一条信息抵达时立刻响应。
信息流是发散:越看越多。报箱是收敛:只在需要时,找到变化。

技术世界每天都在发生事情:新模型发布、开源项目爆发、协议争论、软件漏洞、资本市场噪声,一个看似不起眼的 commit,可能几个月后才显露出价值。问题从来不是没有内容,而是内容抵达人的速度,远远快于人理解内容的速度。于是绝大多数人的解决方式变成了刷新:刷新 HN,刷新 Trending,刷新群聊,刷新收藏夹。信息越来越多,真正的判断却被挤到最后——先点开、先收藏、先转发、先说一句“看看”,然后再也没有然后。
这套系统采用了一个很朴素的分工:
| 层 | 它负责什么 | 它刻意不负责什么 |
|---|---|---|
| 抓取层 | 从公开来源取回新条目 | 解释、推荐、下结论 |
| 报箱层 | 按日期保存原始结果 | 伪装成已经读懂 |
| 读报层 | 按主题筛选、合并、深挖 | 把所有条目复述一遍 |
| 人 | 决定什么值得继续追踪 | 被系统强迫即时反应 |
这四层看起来像工程上的拆分,其实是一种注意力伦理。机器擅长准时、重复、没有情绪地跑一百个链接;人擅长把一个变化放进自己的项目、兴趣和长期判断里。把两件事混在一起,结果通常是机器假装有洞见,人被迫像机器一样不停刷新。
02 · 可回放的管道:让每一层都能被独立追问
这套系统的目录里没有复杂的数据库,也没有一群必须常驻运行的 Agent。核心只有几个文件:一个抓取脚本、一个去重状态、按日期保存的报箱,以及一条“上次读到哪里”的游标。
公开来源
HN · GitHub · 官方博客 · BTC/ETH 论坛 · Reddit · SEC · 行业 RSS
│
▼
抓取脚本 —— 拉取、轻度清洗、标记来源健康
│
▼
inbox/2026-08-14.md —— 当天的原始报箱
│
▼
读报人(AI + 人的提问)—— 按主题合并、验证原文、解释影响
│
▼
判断 / 跟踪清单 / 下一次提问
这里最重要的设计不是“能抓多少源”,而是每一层都可以独立检查。
抓取失败了,可以看日志;日报异常了,可以打开当天的 Markdown;AI 的判断不可信,可以回到原文链接;几天没读,也不会被悄悄吞掉,因为游标记录了上次读到哪天,下一次会自动进入多日补读模式。
这叫可回放。它和很多 AI 产品“给你一个结果,但不知道它怎么来的”正相反。

03 · 邮差的本分:去重、留身份、留原文
抓取层每天要面对的源五花八门:HN 有积分和评论数,适合判断讨论热度;GitHub Trending 有当天新增 star,适合判断开源项目的爆发速度;官方博客与协议论坛更适合判断“有没有新的官方动作”;Reddit 是社区温度计,却很容易被限流、被玩梗淹没;SpaceX 这类主题则同时混着行业新闻、市场评论和 SEC 文件,事实密度天差地别。
所以这套系统不做“大模型总结一切”。它先做三件很小、但很必要的事。
第一,去重。一篇帖子今天 200 分、明天 230 分,不值得每天重复占据版面;只有热度出现明显跃升时,才标为“持续发酵”或“复燃”。系统不试图记住所有内容,而是要记住相较上次,什么变了。

第二,保留来源身份。一篇 SEC 8-K、一篇公司博客、一条媒体报道、一条分析师评级,不能放在同一条证据链上。它们都可以存在,但必须让读者知道:这是公司的一手披露,还是媒体的二手转述,还是市场参与者的观点。
第三,保留原文链接。日报里的 AI 解释只是入口,不能成为终点。读者一旦对某条感兴趣,应该能回到原始讨论、项目仓库、论坛原帖或监管文件,而不是只能相信一段无出处的摘要。
这三件事说起来像常识,很多“AI 新闻助手”却恰恰跳过了:它们把一手材料、二手报道、情绪化评论搅成一锅看起来很流畅的文字。读起来很爽,事后无法追责。
04 · 假平静之罪:失败不得伪装成安静
一个成熟系统的价值,往往不体现在一切正常的时候,而体现在它出错时会不会诚实。
这套系统曾遇到过一次很典型的情况:晨间网络发生 DNS 故障,HN、GitHub、Crypto 等多个来源都没抓到。旧逻辑里,抓取失败和“今天确实没有新内容”都返回空列表,于是日报上出现了整齐的零:HN 0,GitHub 0,Crypto 0。
这是一种危险的假平静。
没有新闻,和没有拿到新闻,不是一回事。
改造后的系统给每个来源增加了三态健康标记:
| 状态 | 含义 | 日报应该怎么说 |
|---|---|---|
ok | 抓取与解析成功,可能恰好没有新条目 | “无新内容” |
partial | 一部分端点成功,一部分失败 | “部分成功”,并列出缺失来源 |
failed | 来源本轮未能取得有效内容 | “抓取失败”,绝不写成 0 条新闻 |
当多个核心来源同时失败,日报会直接标记为“抓取不完整”,脚本以非零状态结束;读报人看到这个标记,就不推进阅读游标,不把空白解释成世界安静了。等网络恢复后重抓,报箱才算真正抵达。
这就是系统设计里一个很朴素的原则:不确定性要作为数据保存,而不是在界面上被抹平。

05 · 证据分级:给一手披露单开一条通道
以某家公司的资本市场情报为例,新闻里可能同时出现“分析师上调评级”“股价回到某个价位”“发射密集”“一份 8-K 文件”。这些标题挤在一起,很像同一个热点,实际上不是同一种东西。
发射数量是运营事实;分析师评级是观点;股价波动是市场结果;10-Q、10-K、8-K 和 13D/13G 则是监管披露。它们的含金量、时效性和可验证性都不同。
因此系统对这类来源做了一个很克制的处理:
- 10-Q、10-K 作为财报类高信号;
- 8-K 根据正文粗分为业绩、融资债务或其他重大事项;
- 13D/13G 作为大股东变化,不把普通持仓文件渲染成经营大利好;
- Form 3/4/5 默认降噪归档;
- 文件不仅要出现在索引里,还要能取回正文、匹配到发行人主体,才进入日报。
最后这一步尤其重要。一个数据源返回了“有一份 10-Q”,不等于系统已经读到了这份 10-Q。链接失效、索引延迟、权限拒绝、公司主体不匹配,都可能让一条看似权威的消息变成错误信号。宁可日报说“正文暂不可核验”,也不要编造出一份不存在的财报结论。
这也是 AI 时代最该被重新强调的常识:可信不是因为语气笃定,而是因为证据链能被回查。
06 · 读报之道:按主题讲变化,而非按来源念菜单
原始报箱仍然按来源保存,因为机器需要清楚自己的输入来自哪里;但最后交到人手上的读报,不应该再按 HN、Reddit、GitHub 排成一排,像念采购清单。
人真正关心的是主题:
- AI 模型与 Agent 工具发生了什么;
- 某个开源生态是否出现了新方向;
- 协议层的讨论有没有影响长期判断;
- 一家公司的运营、融资与市场叙事是否正在背离;
- 哪些看似热闹的消息,其实只是重复转述。
因此,最终输出会按主题组织,并为重点主题生成很短的“信号卡”:新事实是什么、哪些是二手噪声、下一步该验证什么。它不替人做投资决策,也不替人决定立场;它只让下一次提问变得更准确。
比如一张“资本市场雷达”不需要每天把所有股价评论重复一遍。它只需要说:今天有几条一手披露、几条运营事实、几条市场观点;下一个验证点是下一份 10-Q、某份重大 8-K,还是某个实际的商业节点。这样,人不会被热点牵着跑,而是能把热点放进自己的验证框架里。
07 · 留三分摩擦:为什么它不追求全自动
看到这里,可能有人会问:为什么不让 AI 自动读完、自动筛选、自动推送、自动下结论?技术上当然可以。
但“可以”不是“应该”。
一套个人信息系统最容易犯的错误,就是把人最后的判断权也外包出去。你会得到一个看起来很勤奋的助手:它每天告诉你十件事、二十件事、一百件事,甚至替你判断哪些重要。可一段时间后你会发现,自己并没有形成更稳定的认知框架,只是换了一个更高效率的刷屏入口。
所以这套系统刻意保留三个摩擦:
- 要等你来读,而不是不断打断你;
- 要回到原文,而不是只消费摘要;
- 要由人发出追问,而不是由模型替人把世界讲完。
它的目标不是替你活在信息里,而是让信息在需要时为你所用。
08 · 举一反三:这套骨架能长在哪
它并不只适合技术新闻。它其实是一种可以迁移的“私人情报台”模式。
| 场景 | 抓取层可以接什么 | 读报层应该问什么 |
|---|---|---|
| 开源团队 | issue、release、依赖漏洞、PR | 哪些变化会影响路线图? |
| 投资研究 | 公司披露、行业数据、电话会、监管文件 | 新事实是否改变了原先的论点? |
| 内容团队 | RSS、竞品更新、读者反馈、搜索趋势 | 哪个主题值得写,而不是哪个词最热? |
| 家庭与个人 | 日历、健康数据、账单、备忘录 | 哪些变化需要立刻行动? |
底层结构没有变:来源负责发生,抓取负责保存,AI 负责解释,人负责判断。
真正好的 AI 系统,不应该把世界压缩成一个漂亮的答案;它应该让人保有回到事实、重新提问、改变判断的能力。
09 · 尾声:一个替你守着报箱的伙伴
把这套系统剥到底,它其实很小——只是一堆 Markdown、几个 RSS、一批公开 API,加上一个愿意提问的人。但它指向的,也许是一种更值得期待的 AI 关系:不是一个永远在说话的助手,而是一个替你守着报箱、把世界的变化留到你准备好时再打开的伙伴。
也许,AI 最有价值的地方,不是帮我们看得更多。
而是帮我们少看一点,却看得更准。