全部文章

讀一本外語書需要認識多少詞?

老實的數字:大致理解約 5000 個詞族,舒服地獨立閱讀 8000–9000。但更有用的答案是:你不必等到那時候 —— 閱讀本身就是到那兒的方式。

讀一本外語書,需要認識多少詞?

老實的數字:大致理解需要約 5000 個詞族,能舒服地獨立閱讀需要 8000–9000。但更有用的答案是:你不必等到那時候 —— 閱讀本身就是你到那兒的方式。

這是每個學習者最早會問的問題之一,通常是在盯著一本看起來密不透風的小說時:*我到底要認識多少詞才能讀它?*這是個好問題,而且不同於大多數語言學習問題,它背後是有真實數字的。

先給老實的答案,然後給更有用的那個。

來自真實研究的數字

閱讀研究者用詞彙覆蓋率來衡量這件事:一頁上你已經認識的詞所佔的百分比。研究結論驚人地一致:

  • 95% 覆蓋率 —— 每 20 個詞你認識 19 個 —— 大致是勉強理解的地板。你能跟上故事,但會經常猜、經常停。這大約是 4000–5000 個詞族
  • 98% 覆蓋率 —— 每 50 個詞認識 49 個 —— 是舒服、獨立閱讀的門檻,你可以享受一本書而不用不停查詞。這大約是 8000–9000 個詞族

「詞族」指一個基礎詞加上它顯而易見的親戚(read, reads, reading, reader),所以條目數比聽起來少。即便如此:8000 個詞族還是很多,這也是為甚麼那麼多學習者被第一本小說彈開。在 90% 覆蓋率下 —— 那感覺上已經認識很多了 —— 你每十個詞漏一個,大約每頁十個生詞。那不是閱讀,那是解碼。

為甚麼這些數字有誤導性

那些門檻描述的是無援助的閱讀 —— 沒有詞典,不查詞,只有你和這一頁。那是一項真本事,也是值得的目標。但它描述的是終點,不是入口匝道。

因為覆蓋率數字藏起了一件事:詞的分佈並不均勻。少數極其常見的詞構成了任何文本的大部分 —— 光是最高頻的 2000 個詞族,就覆蓋了一本典型小說的大約 80%。剩下的 20% 是一條由罕見詞組成的長尾,其中大多數只出現一兩次。你不需要提前學會這條長尾。你需要的是一種在遇見它們時、在上下文裡、廉價地解決它們的辦法 —— 而你遇見的每一個,都是你此刻正在學的。

所以真正的問題不是「我開始之前需要多少詞」,而是「以我現在的覆蓋率,我該怎麼讀才能把差距合上」。

怎樣在門檻以下讀書 —— 並爬上去

如果你正坐在 90–95% 的覆蓋率上(大多數中級學習者都在這兒),你不必先把閃卡刷到 8000 才敢翻開一本書。你就讀,配三個習慣:

  • **先挑靠近詞頻曲線頂部的書。**兒童和青少年小說用的詞彙更少、更常見,所以你現有的覆蓋率能走得更遠。以 92% 覆蓋率讀你的第一本書,遠比以 92% 去啃一塊文學磚頭愉快。
  • **就地解決長尾詞,別去提前背它們。**你撞上的那些罕見詞,恰恰是接下來最值得學的 —— 而在一個你看得懂的句子裡遇見它們,正是它們能留下來的原因。不離開頁面地查掉,然後繼續走。
  • **讓書來建你的詞表。**你停下來的每一個詞,都是關於你個人差距的一個數據點。在閱讀中收集起來的這些詞,就是你的學習卡組 —— 已經在你的水平上,已經帶著上下文。

這樣讀幾本書,覆蓋率數字會自己解決自己。你從 90% 爬向 98%,靠的不是背詞表,而是一本小說一本小說地遇見那條長尾。

就在你現在的水平上讀

Lucerna 就是為「認識 3000 詞」和「讀得舒服」之間的那段差距造的。上傳任何 EPUB,或從古騰堡計劃拉一本免費書,每一個生詞 —— 整條長尾 —— 離它的釋義、IPA 和完整的動詞變位或格變化表都只有一次點擊,就在頁面上解決,不用第二個分頁。你停下來的那些詞會自己聚成一份生詞表,於是你永遠在學的,恰好是橫在你和下一本書之間的那些詞。今天支援英語、德語和法語,更多在路上。你不需要 8000 個詞才能開始;你需要的是一種在通往那裡的路上還能讀書的辦法。

《閱讀日誌》是 Lucerna 的編輯角落 —— 一款給語言學習者的閱讀 app。這裡寫的是慢慢變流利的短文:一本書,五頁,每晚。