教应用学會發現模式

我做語義聚類,是因為這個問题我自己也有:語音筆记越多,越難回看。

Building

Reso 的一位早期使用者跟我說过一句话:“我有 200 條語音筆记,但一半都想不起在講什麼。”

我聽完只觉得太熟了,因為我自己的語音库也有同樣的問题。capture 型工具让记錄很容易,然後你很快會被數據淹沒。

我希望 Reso 能帮我和其他使用者在時間線上發現思維模式,而不要求手動打標簽或整理文件夹。

核心思路

每條转寫文本都會转成語義表示(embedding)。embedding 相近的筆记,語義上就相關。

當相關筆记積累到一定數量,它们會自動浮現為一個“主题”,并附带自動生成的名字。

例子:两周內我錄了五條關于“API design”的想法。Reso 會自動把它们歸為一組,并標注成 “API Design Patterns”。

聚類難點

算法本身并不复雜,難的是調參:

  • 太激進:所有东西都被并成一個大主题(“工作雜項”)
  • 太保守:每條筆记都是單独主题(几乎沒用)

我花了好几天調相似度阈值,後來才意識到:不存在完美阈值

真正有效的是:Adaptive clustering

不用固定阈值,而是看相似度分布本身。如果數據裡存在自然斷層(比如分數要麼 >0.75,要麼 <0.3),就拿這個斷層當切分點。

這樣“正確阈值”來自這批數據本身,而不是來自我的主觀拍脑袋。

主题命名

這部分意外地難。如何從多條筆记內容裡生成一個靠譜主题名?

我試过:
1. LLM summaries:准,但慢且贵
2. 關鍵词提取:快,但很泛(“Project Update #47”)
3. 第一條筆记標题:簡單,但常常误導

最後我用了:Hybrid approach

先提取高频關鍵词,再用輕量 LLM 調用把它们合成為可讀短語。成本大约每個主题 ~$0.001,足夠快,可以按需觸發。

我学到的

最好的 AI 功能,不會让你觉得“這很 AI”。它更像应用在静静地留意你。

當主题浮現時,使用者不會想“哇,聚類算法真酷”。他们會想:“原來我最近真的一直在想這個。”

這就是魔法:把看不见的东西變得可见。

這不是行銷,是我們自己踩過的坑。

下載 macOS 版 Reso

閱讀更多 Reso 開發歷程