一天时间:用 AI 做个英语词根查询工具(第二季)
我的英语不好。
英语不好就要多看书。
两年前我看了一本词根拆解的书。
那时 gpt-4o 刚发布,我想到要用 AI 做一款英语词根分解工具。
现在看来,当时一切都还不成熟。那时候 DeepSeek 尚未爆火,只是口碑好,便宜;梁文峰还不是梁圣,DeepSeek 甚至无法稳定输出 JSON。
当时创作的文章《一天时间:用 AI 做个英语词根查询工具》,现在看来,当时的问题颇为有趣。信息过时太快,模型的能力解决了绝大多数工程问题;甚至不必再亲自写代码了。这不是我能预料到的。
后来的故事大家都知道。模型能力惊艳世界;DeepSeek 爆火,接口挂了。我也忘了我的工具。
两年后
前两天我偶然刷到自己的网站统计数据,发现这个工具竟然还有人持续在访问,token 不知道是哪天烧光的,靠之前的缓存持续查阅。来路有抖音、今日头条、微信。也不知道是什么人,用抖音和今日头条学英语。
看词汇估计是医生在查,也难怪,他们的词汇也只能拆词根去记忆:什么 hypochlorite、neuroradiologist、cardiothoracic……
感动之余,我做了第二版。
让我来回顾下,当时的问题,在当下都成了过眼云烟。
输出指定格式
输出 JSON (Generating Structured Data)早就不是问题,它现在是一个标准的能力,搞不定这个,这模型都不配上桌。
AI 幻觉
模型能力增加,同时进化出了设置推理(reasoning)模式、WebSearch 工具降低了幻觉。问题还是普遍存在,但在这个场景里堪称基本解决。
费用
这个问题,在两年后已经不再是问题。解决的方式意想不到:大家对 AI 的费用消耗更宽容了。不烧个上百刀都不配嗷嗷叫。
输出较慢
当时我的解决方法是提示大家,新词要等20秒。这一版等待的时间更久了,20秒是输不完的,但用户体验依然可以改进:使用流式输出,也就是让用户看到 AI 当前在干嘛。只是无法再把它包装成一个标准 JSON API 去调用。
提示词优化
可以看到,当年费劲优化的提示词,现在已经没有什么价值;AI 有足够的能力理解细微的提示。
快速开发
这是最让我意想不到的事情。当时我都没意料到这是 AI 最先被解决的问题。我辛苦攒的开源资源放现在毫无用处。
于是我又花了一天时间做了第二版,再回顾这篇文章,发现:碰巧一周年。
这次工程问题没什么好谈的了。AI 时代,技术不再稀缺,好的需求弥足珍贵。那就谈谈需求。
AI 太擅长解决语言问题了。我从来没用过这么好用的语言学习工具。
发音
在过去,大家学发音通常有四种方式
- 老师口头传授
如果那节课你正好没在睡觉 - 看国际音标
通常看不大懂,只能猜个大概,也没人可问。什么,问老师? - 看词猜读音
美其名曰“自然拼读法”,读出来很自然,错得也很自然,反正平时也不用说,错了也没人知道,包括你自己 - 电子辞典发音功能
通常是发现自己念了很多年都念错了,有点怀疑人生,才掏出耳机去听
这意味着,只是传授了单词的不精准读音。它脱离了句子去发音。它没有告诉你发音误区。我用 AI 把这部分内容输出了,顺便集成了 YouGlish:上千个 YouTube 视频里的不同口音下在真实句子里的发音。
例子:endurance

词形拆解与词源
这个和第一版解决了同样的问题,输出了“同根词”和“相同词缀”单词帮助你快速掌握单词组成规律。但使用了上面提到的新技术,可靠性大为增加。它能让你快速掌握单词的组成规律,像 neuroradiologist 这样的超长单词也不会脑壳疼。像这个单词可以拆解成

释义
有时候你以为你懂了某个单词,其实你不懂。比如 bear。小时候大家都知道它的意思是熊(A2 级别的意思)。学了几年后知道它还代表“忍受”(B2 级别的意思)。再学学发现导航播报bear left,它还代表靠左走。再学学,发现它还能代表生育(bear fruit)。

词在句子里的用法
大家翻字典,通常会有一些例句帮助你理解,但是并没有提取成词在句子里的常见结构。 更没有标注含义难度信息。有了难度信息,你可以有的放矢:忽略高难度含义,巩固低难度词汇。
例子:bear
没有标注常见错误
句子在辞典里总是光荣正确的,不会把大家常犯错误标注出来;但其实这是学习的捷径。
例子:attach
最后
如果你需要查词,可以试用下我花一天时间做出来的第二版工具。后续我还会结合我的英语学习体验,加入更多功能,比如英语播客。
👉前往茶光词本