为什么我们自己做了个笔记工具
笔记的问题
我的笔记到处都是。
课堂笔记在 Notion。会议纪要在飞书文档里——名义上还是公司的。腾讯会议通话的语音备忘录在手机上。纸质笔记本用来写需要手写才想得清楚的东西。还有一个 Obsidian 库,总想着回去整理,一直没动。
没有一样在一个地方。没有一样互通。当我想找两周前项目启动会上某人说的话时,翻了四个应用还是找不到。
问题出在这些工具的设计方式:每个都锁死在自己的生态里。飞书只能录飞书的会议。腾讯会议只处理腾讯会议的内容。Granola 只支持 Mac。中英文混着说的会议?没一个处理得好。如果你每天在 3–5 个平台之间切换——大多数中国职场人都是这样——笔记天然就是碎的。
现有工具差了点什么
Granola 是最接近我们想要的东西。它在后台听你的会议,结束后自动生成 AI 笔记。体验确实不错——不加机器人,不打扰你,就是安静地录。
但它的核心假设是:转录稿是主要输入,你自己的笔记只是附带。输出是对"会上说了什么"的总结,不是一份反映你思考方式的文档。
转录稿总结的上限取决于会上说了什么。但会议不能捕捉所有东西——背景信息在准备材料里,在你开会前写好的决策标准里。Granola 没办法把这些纳入。
而且中文支持很弱。中英文混着说的会议——一句话里切来切去的那种——转录质量明显下降。公式渲染不了,斜杠命令打断中文输入,编辑器完全假设你只用英文。
反过来的思路
InkWeave 从反方向出发:你的笔记是主要输入,转录稿补充你漏掉的部分。
Granola: 转录稿 → AI 摘要
InkWeave:你的笔记 + 转录稿 → AI 综合 → 结构化文档
AI 把会上说的和你本来就在想的连接起来。输出反映的是你的思考方式,不只是会议上发生了什么。
InkWeave 有三种模式:
- 纯笔记 — 粘贴草稿笔记,得到结构化文档(不需要音频)
- 纯音频 — 上传录音,纯转录模式
- 笔记 + 音频 — 最高质量输出,InkWeave 最擅长的模式
一起做的
InkWeave 起源于一通深夜电话。那天心情不太好——就是那种没有什么特别的事、但就想找人聊聊的晚上。和家龙有一搭没一搭地聊着,聊到后来不知怎么就碰出了一个有意思的想法,越说越觉得可以试试。第二天就开始动手了。
两周之后,我们已经在疯狂互推代码了,进度快到我俩自己都有点意外。家龙之前几乎没怎么写过代码,但他不带我从课堂和以前项目里积累的那些预设——有时候这意味着起步慢一些,但有时候他会往我完全不会考虑的方向走。让我意外的是,光是看他探索的过程就学到了很多。
有一件事很快就变得明显:瓶颈不在系统。AI 处理笔记、生成结构、综合内容几乎是瞬间完成的。真正慢的是一件更人的事——想清楚该怎么问。写好提示词、组织好输入、想明白什么才是重要的。系统越快,我们自己的思考速度作为瓶颈就越明显。
一起探索这件事本身,最后变得和产品一样重要。
我们做了什么
编辑器是 Obsidian 风格的:Markdown 优先,支持 KaTeX 数学公式和 Mermaid 图表。中文输入不会有格式 bug。图片粘贴直接用。是个真正的编辑器,不是文本框。
音频有两条路径。上传文件,走 Whisper(用 faster-whisper 后端,中文准确率更高)。或者直接在浏览器里录制,带实时转录和说话人分离——输出知道谁说了什么。
转录完成后,选一个模板点生成。Claude 同时读你的笔记和转录稿,按模板产出结构化输出:会议纪要、课堂笔记、面试评估、导师谈话、项目总结,或者你自定义的格式。
模板本质上是 Claude 的系统提示词,所以加一个新模板就是写一段 prompt。用户可以自定义。
什么难做
双语语音识别比预想的难。Whisper 单独处理中文还行,但真实会议是一句话里中英文来回切的。我们对比了讯飞 ASR、阿里 ASR 和 Whisper。Faster-whisper 配调优模型在真实混合录音上的准确率和成本比最优。
编辑器和转录稿的分栏更像是 UX 问题而不是技术问题。怎么展示两个输入——笔记和转录稿——又不让界面看起来像两个独立工具?目前的方案:编辑器为主,转录稿在可折叠面板里,生成的时候把它们无形地连接起来。
模板设计比我们想的迭代了更多轮。"会议笔记"听起来简单,真正要定义什么结构能帮人记住和行动,得花不少功夫。最好的模板有自己的主张:明确提取决策、行动项和待解决的问题,而不只是做段落摘要。
下一步
Web 版已经部署上线了。下一步是做一个桌面应用(Tauri),静默捕获系统音频——不用上传,不用按录音键,打开腾讯会议或飞书的时候 InkWeave 就已经在听了。
到那个版本,开完会切到 InkWeave,结构化笔记已经在那里了。
在 inkweave.alexshen.dev 可以试用,免费的。