Building
Reso 的一位早期使用者跟我說过一句话:“我有 200 條語音筆记,但一半都想不起在講什麼。”
我聽完只觉得太熟了,因為我自己的語音库也有同樣的問题。capture 型工具让记錄很容易,然後你很快會被數據淹沒。
我希望 Reso 能帮我和其他使用者在時間線上發現思維模式,而不要求手動打標簽或整理文件夹。
核心思路
每條转寫文本都會转成語義表示(embedding)。embedding 相近的筆记,語義上就相關。
當相關筆记積累到一定數量,它们會自動浮現為一個“主题”,并附带自動生成的名字。
例子:两周內我錄了五條關于“API design”的想法。Reso 會自動把它们歸為一組,并標注成 “API Design Patterns”。
聚類難點
算法本身并不复雜,難的是調參:
- 太激進:所有东西都被并成一個大主题(“工作雜項”)
- 太保守:每條筆记都是單独主题(几乎沒用)
我花了好几天調相似度阈值,後來才意識到:不存在完美阈值。
真正有效的是:Adaptive clustering。
不用固定阈值,而是看相似度分布本身。如果數據裡存在自然斷層(比如分數要麼 >0.75,要麼 <0.3),就拿這個斷層當切分點。
這樣“正確阈值”來自這批數據本身,而不是來自我的主觀拍脑袋。
主题命名
這部分意外地難。如何從多條筆记內容裡生成一個靠譜主题名?
我試过:
1. LLM summaries:准,但慢且贵
2. 關鍵词提取:快,但很泛(“Project Update #47”)
3. 第一條筆记標题:簡單,但常常误導
最後我用了:Hybrid approach。
先提取高频關鍵词,再用輕量 LLM 調用把它们合成為可讀短語。成本大约每個主题 ~$0.001,足夠快,可以按需觸發。
我学到的
最好的 AI 功能,不會让你觉得“這很 AI”。它更像应用在静静地留意你。
當主题浮現時,使用者不會想“哇,聚類算法真酷”。他们會想:“原來我最近真的一直在想這個。”
這就是魔法:把看不见的东西變得可见。
這不是行銷,是我們自己踩過的坑。