跳到主内容
精选90人人都是产品经理(RSS)产品与增长

背词小程序方案:真题词频排序覆盖91.5%考点

需求调研报告:高职高考背真题单词微信小程序

原文
推荐理由

做教育工具或垂直细分产品的同学可以直接抄作业:真题词频怎么统计、前756词覆盖91.5%考点的排序逻辑、间隔复习的1/2/4/7/15/30天参数、免费+激励广告的变现闭环,全都有具体数字和取舍依据。

中职生升学竞争激烈,英语背词却缺乏精准工具。本文基于2008-2025年真题词频统计,揭示高频词覆盖九成考点,提出以词频排序和间隔复习为核心的提分方案,为考生提供高效备考新思路。

一、问题假设

全国中等职业学校在校生 1784 万人,其中超过一半毕业后选择升学。这条升学路在广东叫”3+证书”高职高考,2026 年报名 196759 人,公办名额 79489 个,招生总计划 12.97 万。数字一减,差出来的 6 万多人不在计划内。再看分数线,300 分以上的考生一年时间从 20959 涨到 35622。

竞争卷成这样,英语这块却有个反常的事:市面上给这些考生的背词工具,没有一个把”真题考频”做精确。考生英语普遍是短板,很多人词汇量离中考要求还有距离,却要在几个月里(9 月开学、次年 1 月考试)应付这场决定升学的考试。

他们要的不是”学好英语”,是把有限时间花在最可能考的单词上,最后提分。

动笔之前,我先把 5 条初步判断列出来,后面的调研就围绕这几点逐一验证。

判断 1:真题词频比大纲词更值钱

市面上高职高考词书给的都是大纲词,考纲列了哪些就背哪些。但大纲词是”可能考”,真题词是”真的考过、考过几次”。

这里先把一个差别讲清楚。大纲词和真题词是两回事。大纲词是考纲划的范围,理论上会考,可很多词真题压根没考过,或者只出现过一次。真题词是从 2008 到 2025 年的真题试卷里一个一个数出来的,哪个词考过、考过几次,一目了然。

举个具体的词:research。它在 2008 到 2025 年的真题里出现了 15 次,在 2198 个真题词里排第 382 位。大纲词表会告诉你 research 要背,但它不会告诉你 research 只考过 15 次、前面还有 381 个词比它更该先背。词频排序解决的不是”背不背”,是”先背哪个、背到多深”。

再看几个词,感受更直观。the 出现 2240 次、be 出现 1907 次、to 出现 1468 次,这三个词加起来就占了总频次的一成多。它们考生基本都认识,所以真正的差距在中频词:research 考过 15 次,你认识,阅读理解就多一分把握;不认识,那一句就读不通。

词频数据还藏着一个更惊人的事实:2198 个真题词,在 2008 到 2025 年的真题里总共出现了 39941 次,但分布极度不均。前 100 个词,只占全部词的 4.5%,就覆盖了 62% 的出现次数;前 756 个词,占 34%,覆盖了 91.5%。

还有一个反直觉的细节:2198 个真题词里,频次的中位数只有 3 次(2198/2=1099,在我自己整理的真题词库里面,对应的单词的词频是3次)。也就是说,一半的真题词,十几年里只考过 3 次或更少。这反过来印证了词频的价值:大多数词都是低频的,不值得平均用力,把力气集中在头部的几百个高频词上,才是聪明的做法。

翻译成人话:考生只要背下前 756 个高频词,就能覆盖九成以上的真题词汇考点。反过来,剩下 1442 个低频词,加起来才占不到 9%。这就是词频排序的核心价值:用最小的背词量,覆盖最大的考点。

大纲词表不会告诉你这些。它只会告诉你”这几千个词都在考纲里,都要背”。但考纲里既有真题反复考的高频词,也有十几年一次都没考过的词;反过来,真题里还有一些考纲没收录的超纲词。百词斩的中职词本 2264 个词、不背单词的中职大纲 2250 个词,都是这个”大而全”的路子。背大纲词,你分不清手里这几千个词里,哪些反复考、哪些只考过一次、哪些压根没考过,只能在”都要背”里平均用力。词频排序补的,正是这份”优先级”。

词频还能顺势解决”时间不够怎么办”。出现 7 次及以上的 756 个词,适合时间最紧的冲刺期,覆盖 91.5% 的考点;出现 2 次及以上的 1603 个词,适合时间宽裕的稳扎稳打。考生按自己的备考时间选档位,而不是一刀切背完整本。时间紧背高频,时间多背全量,这个选择权交给考生。

词频数据还带了一个年份维度。每个词在哪些年份考过,都记得下来。有的词 2018 年考过、2020 年又考过,是”反复考的稳定考点”,优先级高;有的词只在 2008 年出现过一次,之后再没露面,优先级就低。年份让词频不止是”考过几次”,还是”最近考不考”。这两者合起来,才是一张真正能指导备考的词表。

再补一个背景。三家主流背词 App 其实都有高职高考词本,百词斩官方一个、不背单词官方一个、墨墨的云词本里还有网友上传的多个。但这些词本要么是大纲词,要么是网友自己整理的词表,没有一个是从真题里统计出精确频次的。所以差异化不是”没人做词库”,是”没人做真题词频”。这一条修正很关键,它把靶心从”空白赛道”收窄成了”空白打法”。

短语是同一套逻辑。真题里的固定搭配同样是考点,一个短语的意思往往和逐词翻译不一样。697 个真题短语,和 2198 个真题词一样,从 2008-2025 真题里逐个统计、按频次排好序。单词和短语两个库分开,可以单独背,也可以配合背。

注:真题词频为核心差异化功能,大纲词表为基础标配功能;笔者表达重点是主打 “优先级排序提效”,而非完全替代大纲词。

判断 2:遗忘是背单词的头号敌人

从行业普遍认知和用户反馈来看,“背了就忘、反复内耗” 是背单词用户中途放弃的核心原因。

德国心理学家艾宾浩斯 1885 年拿自己做实验,发现遗忘有明确的时间规律:学完 20 分钟,忘掉 42%;1 小时,忘掉 56%;1 天,忘掉 74%;1 个月,忘掉 79%。这条曲线的含义是:刚背完的单词遗忘最快,但只要踩准时间点复习一两次,就能把记忆稳住,越记越牢。

而认知心理学的间隔效应研究表明,定期间隔复习可显著提升长期记忆留存率:一周内进行复习,记忆保持率会大幅回升;保持稳定的间隔复习节奏,长期记忆留存可维持在较高水平。

还有一点要说清楚,这是这段最有科普价值的地方:艾宾浩斯当初实验用的材料是无意义音节,比单词更难记。他的实验里,记 12 个无意义音节要重复 16.5 次,记六首诗里的 480 个音节只要重复 8 次。单词介于两者之间:它有意义,但不是诗歌那种强意义,所以需要复习,但不用像无意义音节那样死磕。 这一条直接决定了复习的设计——单词的复习既不能照搬无意义音节的高强度重复,也不能像诗歌那样只靠理解一遍过,而是用间隔复习踩准遗忘点。间隔复习,就是给单词这种材料找到最省力的记忆节奏。

市面主流背词产品的复习机制普遍存在体验短板:要么将复习算法作为后台隐性机制,用户对复习的价值感知弱;要么复习节奏设计僵硬,任务易堆积引发用户焦虑;要么为了趣味性牺牲记忆深度,复习实际效果打折扣。而本产品将复习机制与词频筛选作为两大核心骨架,核心逻辑正是:遗忘才是背单词路上的核心障碍。

结合遗忘规律与复习效果的对照可以得出明确结论:只靠不断增加新词量,本质上对抗不了自然遗忘。真正能提升长期记忆留存、减少用户流失的,是科学的复习节奏。一套可靠的间隔复习机制,比单纯扩充词库容量对用户更有价值。

间隔复习的机制,是在遗忘刚要发生、还没彻底忘掉的时间点,把记忆拉回来。每拉回来一次,记忆痕迹就深一分,下次能撑的时间就更久。所以复习间隔是”先密后疏”:1 天、2 天、4 天、7 天、15 天、30 天,逐次拉长,并且采用动态间隔算法(根据用户对单词的掌握程度:认识 / 模糊 / 不认识,动态调整间隔)。这也是为什么 “该复习时才复习” 比 “每天机械重复” 更高效。在总复习时间和次数相近的前提下,按照遗忘规律安排的间隔复习,比每天集中重复的记忆效果更好,单位时间收益更高。复习不是越多越好,而是要恰到好处。

判断 3:应试要的是”认识”,不是”拼写”

高职高考英语总分 150 分,其中作文 10 分、完成句子 15 分,这 25 分需要手写拼写;其余 125 分,占 83%,单词认不认识,直接决定了这 125 分能不能拿到手。对备考时间紧张的同学来说,先把占比 83% 的客观题分数稳稳攥在手里,再用少量精力攻克拼写和写作,才是性价比最高的提分路径。(这里的认识,不是死背单个中文释义,是看到单词能反应出考试常考的核心意思,放到句子里也能看懂)

再看考生基础。中职英语主流备考资料覆盖的词汇量约2000出头,但不少同学备考时都有同感:真正能熟练认出来的单词没多少,很多人还停留在初中 1000 词左右,甚至更低的水平。他们最大的瓶颈不是”不会写”,是”不认识”。不认识,阅读理解读不懂,125 分拿不全;认识,阅读就能做,分就有了。

这决定了产品形态:考生更多需要”看到单词知道意思”,而不是默写。自评”认识/模糊/不认识”这种轻量标记,比强制拼写更贴合考试,也更快。三秒过一个词,和拼一个词花十秒,在时间紧的考生手里是两种效率。83% 的分数用”认识”就能拿,那为什么要把力气花在 17% 的拼写上。

市面主流背词产品的核心交互模式各有侧重:百词斩以图片联想选图为主,交互轻但记忆锚点易偏移;不背单词以语境例句为核心,场景真实但内容负载重;部分产品主打强制拼写默写,交互最重、单位效率最低。

三级自评走的是”主动回忆”的路子,但更轻:不用拼写,不用选图,只用三个按钮标记”我还认不认识”。它把记忆重点完全落在‘应试词义识别’上,去掉了拼写默写、图片选择等多余环节,只用三个按钮就能标记掌握程度,三秒过一个词,背词速度直接拉满。

判断 4:免费加轻量广告,比会员付费更适合这个群体

1.词汇服务分层定位

以3大头部app为例:

先拆解头部APP的免费 / 付费边界,避免 “背单词头部app全免费” 的笼统认知:

免费层(行业标配):墨墨背单词、百词斩、不背单词均提供全国统一的中职英语大纲词本,词本本身没有解锁门槛,可免费添加使用。事实上,这类标准化、公共类大纲词本(包括中职大纲)在各产品中基本都免费开放(不背单词和百词斩的真题词本除外),用户默认这是使用产品的基础条件。它们的核心作用是满足最基础的背词需求,负责拉新与留存;一旦在词本添加入口设置收费,绝大多数新用户会直接流失。也正因如此,这部分内容同质化程度高,缺乏地区针对性。回到高职高考词本本身,三款头部APP都是免费的,是全国通用、无差别的中职大纲词,这是无壁垒的公共内容,免费是行业标配,不构成任何竞争优势。

付费层(增值服务):三款头部产品的共性很明确:均未覆盖广东高职高考专属真题词库,也没有任何与地区真题相关的付费内容。它们的付费体系全部围绕通用背词功能、部分词书和词典权益展开,和垂直地区的考情针对性内容基本无关。换句话说,全赛道目前没有任何一款头部产品,把“分省份的高职高考真题词”作为独立内容供给,更没有形成对应的免费或付费定价。这意味着这是一个空白赛道,不存在“头部APP都免费,我设门槛不合理”的对标前提。

2.我方商业化机制的合理性论证

把 “每日 30 个免费新学单词额度 + 激励广告扩容 + PDF 免费公开” 串成闭环逻辑:

  • 核心价值锚点:我方设置额度与广告门槛的对象,是广东高职高考真题高频词库(非通用大纲词),属于头部APP未覆盖的垂直细分内容,内容壁垒来自真题考频统计与地区专属整理,有明确的内容成本与稀缺性。
  • 每日免费额度:每日 30 个新学真题词额度(不跨天叠加),用于降低用户体验门槛,让用户快速感知真题词的精准度,完成核心价值验证,对应 “先体验再接受门槛” 的路径。
  • 激励广告扩容:观看 1 次激励广告解锁 30 个新学真题词额度,在不强制付费的前提下,通过广告变现覆盖真题整理与产品运营成本,同时兼顾免费用户的使用需求,避免与头部APP在通用大纲词上做无意义的免费内卷。
  • PDF 免费公开:纯单词表 PDF 面向全网免费,核心作用是内容引流、建立专业口碑;与 小程序 端形成明确分层 ——PDF 仅为静态单词资料,无记忆算法、无真题例句、无进度管理、无复习提醒,小程序 端提供的是完整的背诵服务体验,形成 “免费资料引流 → 小程序 功能体验 → 广告转化” 的完整漏斗。

判断 5:”被看见”能维持坚持

背单词属于长周期、低即时反馈的学习行为,用户独自学习易出现动力衰减、中途放弃的情况。打卡记录、连续学习天数、可分享学习海报等设计,可通过两类心理机制提升用户粘性,对应解决「能否长期坚持」的问题,是提升产品留存的重要辅助手段。

  • 社交自我呈现机制:学习进度与成果的可分享性,满足用户的自律形象展示与社交赞许需求,外部可见的学习记录会形成隐性的社交监督,强化用户的坚持意愿。
  • 损失厌恶与沉没成本效应:连续学习天数会让用户逐步形成心理所有权,中断连续记录会被用户感知为明确的损失;同时已累计的天数构成沉没成本,进一步提升用户的持续使用意愿。相较于单日打卡,连续天数设计的粘性更强。

注:该机制对中高频活跃用户效果更显著,对低频新用户存在断签挫败导致流失的风险,设计上需配套补签等缓冲机制。

二、用户研究(为什么市面上的 App 帮不上)

我把这三个背词 App 翻了一遍,看它们的用户在骂什么、夸什么。先说明一句:公开评论天然偏向吐槽,满意的人大多不说话,所以下面是”痛点线索”,不是”全体用户的真相”。

百词斩:记住了图,没记住词

百词斩的招牌是”一词配一图”,图片联想降低了入门门槛。但门槛低了,记忆也停在了图上。

一位用户写得很直白:”我用百词斩背了 3 个月,单词书刷了大半,结果做阅读时还是一脸懵——图片记得清清楚楚,单词意思死活想不起来。”

还有测评点得更透:”图文记忆容易形成’图片记忆替代单词记忆’的误区,用户往往记住了图片,却记不住单词本身的释义和拼写,应试实用性差。”

所以,准确地说,不是图片联想本身不好,而是它的图文记忆模式更适配入门级兴趣用户,也更容易被本身对图像敏感、擅长联想记忆的用户接受;但无论哪类用户,只要以应试提分为核心目标,这种模式都可能带来“图片依赖、识义不牢”的短板,无法满足精准应试需求。 换句话说,判断它是不是坑,关键看目标。 对“应试提分”这个目标来说,图片联想确实是个坑:它解决了“不想背”的情绪,没解决“考试看到单词要想起意思”这件事。高职高考英语超八成分值都在阅读、完形等客观题,核心考的就是“看到单词能反应出意思”。

墨墨:初始上限低,免费扩容慢,功能偏专业向

墨墨的算法和词库口碑不错,记忆模型论文还发过 ACM SIGKDD 和 IEEE TKDE。它的“按单词上限收费”是其商业化设计,并非产品缺陷;但对高职考生来说,初始额度低、免费扩容周期长、付费扩容有成本,确实会形成使用障碍。

商业化门槛:初始上限低,免费扩容慢,付费扩容有成本

墨墨的免费用户初始单词上限为 600,而高职考纲词汇量远超这一数量,初始额度无法覆盖学习需求。虽然用户可通过连续签到、分享等方式免费扩容,坚持打卡累计上限也仅接近 2000 词,但免费扩容速度较慢、周期较长,对于备考节奏紧张、需要在短期内大量背词的中职考生来说,仍难满足需求;若要快速获得足够上限,则需付费扩容。《电脑报》2024 年的测评显示:“增加 1800 个单词上限需要 25 元,最高可增加 16000 个单词上限,价格为 163 元。”这意味着一个要背几千词的考生,要么投入较长时间免费打卡,要么提前付费,对价格敏感的中职用户接受度有限。

操作门槛:功能偏专业向,对基础薄弱用户不友好

产品功能偏专业向,词库选择、学习数据看板等配置项较多,对基础薄弱、无自主学习规划能力的用户存在使用门槛。一位家长记录孩子用墨墨的感受:“墨墨背得牢,可她嫌要选词库、看曲线图,像做数学题。”对基础本来就弱的中职生来说,光是挑词库(特别是高职高考的词库,墨墨有非常多的网友上传的云词本)、看各种数据曲线就头大,越复杂越不想打开。

不背单词:复习越积越多,一次背太久

不背单词的语境记忆很强,43 万个评分、4.8 分,是口碑最好的之一。它的复习机制采用间隔重复算法,这本身是记忆类产品的通用设计,适配学习节奏稳定的用户;但对学习时间碎片化、易中断的高职考生来说,固定的强制复习容易造成任务堆积。

《电脑报少年派》2024 年的榜单点出:“如果词汇积累量较大,学新词加上强制复习单次使用时间会比较长,增加用户坚持的难度。”这并非单纯的设计缺陷,而是间隔重复机制在非稳定学习节奏下的共性现象——用户一旦中断学习,复习量就会累积,再次打开时单次学习时长被显著拉长,容易从“帮我记”变成“追着我跑”。对时间本就不稳定的中职考生来说,这种体验会明显提升放弃概率,这也是放弃的第二大原因。(第一见前文判断2)

三家的共同空白

把这三家放在一起,结论很清楚:它们在”通用背词、产品体验和算法积累”上做得很深,在”精准应试提分、针对地区细分考试”上留了空档。有高职高考词本,但都是大纲词或网友词表;有遗忘曲线,但没对准一场具体考试。

(说明:以上原话均来自公开搜索结果,出处见文末。评论区天然偏向吐槽和负面,这些声音是痛点线索而非全体用户真相。)

行业数据

三家用户体量都不小,百词斩官网自称”超 2 亿人使用”。但规模大不等于覆盖了这个细分。它们的词库是”小学到留学”的通用词库,谁也不会为一场地区性考试专门做一套精确词频。这跟电商巨头不做某个县城的小众商品是一个道理:盘子够大,但切口不够细。

具体到高职高考,三家的情况是:百词斩官方有一个高职高考词本,不背单词官方也有一个,墨墨官方词书没有、但云词本里有网友上传的多个。这三个词本有个共同点:都是大纲词或网友整理词表,没有一个是从真题里数出来的精确频次。”有词本”和”有真题词频”,中间隔着一条从 2008 数到 2025 的河。

为什么是高职高考,不是四六级

做背单词工具,先得选一个市场。四六级、考研、雅思托福,这些市场大,但早就被百词斩、墨墨、不背单词瓜分干净了。进去就是拼算法、拼内容生态,一个单人开发者没有胜算。

高职高考不一样。全国中职在校生 1784 万,超过一半毕业后选择升学。广东一省,2026 年 3+证书报名 196759 人,公办名额只有 79489 个。这个盘子够大,大到值得专门做一款产品;又够小,小到头部产品的通用化内容策略与边际成本模型,决定了其不会为区域级细分考试投入专属的真题词频研发资源,这里因此存在内容供给空白。

这中间的空档就是机会。巨头的通用词库覆盖不到这场地区性考试的精髓,细分玩家又做不透。一个懂这个考试、又愿意从真题里一个个数词频的人,有机会在这个切口里站住。

把”背单词”这件事拆开

光看评论还不够,把”背单词”本身拆开,看用户在完成什么任务。

这张表里藏着一条容易被忽略的线。功能层的三个任务,对应的是”提分”这件事的硬指标:背对词、记得住、有进度。社会层和情感层,对应的是”坚持”这件事的软指标:被看见、不花钱、有确定感。

三层任务里,功能层的”背对词、记住不忘”是地基,社会层和情感层是让用户愿意每天回来的燃料。头部APP的显性设计和宣传重点,大多集中在打卡、社区、界面、多样式助记内容、算法等这些地方;但针对地区性高职高考这场具体考试的精准词频、考情适配,没有人做深做透。

两个典型用户

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近