读一本外语书,需要认识多少词?
老实的数字:大致理解需要约 5000 个词族,能舒服地独立阅读需要 8000–9000。但更有用的答案是:你不必等到那时候 —— 阅读本身就是你到那儿的方式。
这是每个学习者最早会问的问题之一,通常是在盯着一本看起来密不透风的小说时:*我到底要认识多少词才能读它?*这是个好问题,而且不同于大多数语言学习问题,它背后是有真实数字的。
先给老实的答案,然后给更有用的那个。
来自真实研究的数字
阅读研究者用词汇覆盖率来衡量这件事:一页上你已经认识的词所占的百分比。研究结论惊人地一致:
- 95% 覆盖率 —— 每 20 个词你认识 19 个 —— 大致是勉强理解的地板。你能跟上故事,但会经常猜、经常停。这大约是 4000–5000 个词族。
- 98% 覆盖率 —— 每 50 个词认识 49 个 —— 是舒服、独立阅读的门槛,你可以享受一本书而不用不停查词。这大约是 8000–9000 个词族。
"词族"指一个基础词加上它显而易见的亲戚(read, reads, reading, reader),所以条目数比听起来少。即便如此:8000 个词族还是很多,这也是为什么那么多学习者被第一本小说弹开。在 90% 覆盖率下 —— 那感觉上已经认识很多了 —— 你每十个词漏一个,大约每页十个生词。那不是阅读,那是解码。
为什么这些数字有误导性
那些门槛描述的是无援助的阅读 —— 没有词典,不查词,只有你和这一页。那是一项真本事,也是值得的目标。但它描述的是终点,不是入口匝道。
因为覆盖率数字藏起了一件事:词的分布并不均匀。少数极其常见的词构成了任何文本的大部分 —— 光是最高频的 2000 个词族,就覆盖了一本典型小说的大约 80%。剩下的 20% 是一条由罕见词组成的长尾,其中大多数只出现一两次。你不需要提前学会这条长尾。你需要的是一种在遇见它们时、在上下文里、廉价地解决它们的办法 —— 而你遇见的每一个,都是你此刻正在学的。
所以真正的问题不是"我开始之前需要多少词",而是"以我现在的覆盖率,我该怎么读才能把差距合上"。
怎样在门槛以下读书 —— 并爬上去
如果你正坐在 90–95% 的覆盖率上(大多数中级学习者都在这儿),你不必先把闪卡刷到 8000 才敢翻开一本书。你就读,配三个习惯:
- **先挑靠近词频曲线顶部的书。**儿童和青少年小说用的词汇更少、更常见,所以你现有的覆盖率能走得更远。以 92% 覆盖率读你的第一本书,远比以 92% 去啃一块文学砖头愉快。
- **就地解决长尾词,别去提前背它们。**你撞上的那些罕见词,恰恰是接下来最值得学的 —— 而在一个你看得懂的句子里遇见它们,正是它们能留下来的原因。不离开页面地查掉,然后继续走。
- **让书来建你的词表。**你停下来的每一个词,都是关于你个人差距的一个数据点。在阅读中收集起来的这些词,就是你的学习卡组 —— 已经在你的水平上,已经带着上下文。
这样读几本书,覆盖率数字会自己解决自己。你从 90% 爬向 98%,靠的不是背词表,而是一本小说一本小说地遇见那条长尾。
就在你现在的水平上读
Lucerna 就是为"认识 3000 词"和"读得舒服"之间的那段差距造的。上传任何 EPUB,或从古腾堡计划拉一本免费书,每一个生词 —— 整条长尾 —— 离它的释义、IPA 和完整的动词变位或格变化表都只有一次点击,就在页面上解决,不用第二个标签页。你停下来的那些词会自己聚成一份生词表,于是你永远在学的,恰好是横在你和下一本书之间的那些词。今天支持英语、德语和法语,更多在路上。你不需要 8000 个词才能开始;你需要的是一种在通往那里的路上还能读书的办法。
《阅读日志》是 Lucerna 的编辑角落 —— 一款给语言学习者的阅读 app。这里写的是慢慢变流利的短文:一本书,五页,每晚。