小孩子可以学 AI 原理吗?
从很想听听佬们的意见:孩子真的不能学习AI原理吗?继续讨论:
今天刷到一个帖子,发起讨论「孩子是否可以学习 AI 原理」。帖主 @StarFox 认为可以,因为简单理解 Transformers、CoT 的原理不一定要有数学基础。立刻有人反驳:不会线性代数,搞不明白向量叉乘,没有基础、黑盒学习能有什么效果?

帖中讨论的对象主要是四、五年级到初中的小孩子,而幸运地,我正是在这个年龄段开始接触和使用 AI,也属于讨论的对象中的一员。评论区不少人是大学生、研究生、博士生,更多的人已经毕业工作,学识和能力都无疑在我之上,对于 AI 的理解也远比我深刻。然而,一些人对于我们的推测和断言,与我的体会有所偏差。古人云「耳闻之不如目见之,目见之不如足践之」,所以我基于实践中的体会,今天斗胆来分享下自己的一些看法,还请多多指教。
先中译中一下帖主的意思。他所说的「简单理解」其实是一种直觉上的理解,或者说是「通过理解内涵逻辑从而塑造培养直觉」的方法。
比如梯度下降,公式上的理解是 \(\boxed{\theta_{t+1}=\theta_t-\eta\nabla J(\theta_t)}\)。而直觉上理解梯度下降则只需要在脑中构建一个高低起伏的空间,一个点从某一个位置出发,总是朝向向下坡度最大的方向移动,最终所有方向坡度都向上时(在谷处)停止。
不难发现,公式上的理解通常需要积分、导数、矩阵乘法、凹凸性的高数知识,而在直觉上理解是并不需要数学基础,是个人都会。在这里,如何表示「高低起伏的空间」、如何计算「向下坡度最大的方向」是哪个、如何计算「向特定方向移动后的坐标」,都像一个个封装好的函数。函数里具体是如何实现的,在这个阶段不必了解。
这就反驳了评论中常见的一种错误观点:学习原理就必须有高数基础。

接着我们再看评论中另一个常见观点:学习原理对应用没用。实际上,这种「直觉上的理解」对于应用 AI 相当有用。
因为如果他们在直觉上理解了注意力机制,就不难理解为什么指令要求后面加上一堆感叹号不能起到强调作用反而会稀释注意力,为什么 prompt 重复两遍可以提升性能、而重复五遍会降低表现1。如果他们在直觉上理解了 Tokenizer 的原理,看到模型算出 9.11>9.9、strawberry 里有 2 个 r 就不会大惊小怪2。如果他们知道每次预测都要综合计算前面所有上下文的 KV 矩阵,就能明白 context 管理的重要性,也就能明白如果模型拒绝要求时继续说服是没有效果的3。如果他们了解过拟合,就很容易推理出为什么 <think> 可以获得随机回复4。如果他们理解了语义激活,就能明白为什么 prompt 中使用正面要求比负向写法效果更好5。

再说说评论区中的另一种观点,就是愿意学习、有能力学习 AI 原理的孩子太少了。这就是太低估新时代的小孩子们了。读到这里可能一些人觉得我很厉害,而这种厉害只是个例。这句话有两个错误,第一,我并不厉害,第二,有无数比我年龄小、却比我厉害的多的人。前年我和学校里的一位同级生一起参加比赛,他在没有 Claude Code 的时代就已经精通十几种编程语言6。他在那场比赛中获得一等奖,而我却忘了保存拿了零分。今年我考入了苏州中学,而和我同一年入学的,还有比我小半岁、却维护着一个规模比我的项目大得多的 GitHub 仓库的 Nemo2011。今年是他维护这个 4.2k stars 仓库的第五年。即使倒退回几年前,以他们的智商和能力,不可能学不会 AI 原理。这样的人我身边就有三四个,可想而知,有能力有兴趣学习 AI 原理的孩子绝不在少数。

回到最初的问题。小孩子可以学习 AI 原理吗?当然可以。「原理」本身是分层的,不会线性代数和矩阵求导,确实很难严格推导 Transformers 或理解反向传播,但并不影响先建立对 AI 的基本认知。不理解模型边界,就容易把它当成永远正确的工具;不理解 token 和生成方式,就很难解释它为什么在数字、格式上频频出错。如果一开始就要求必须掌握高数线代才能谈原理,会把门槛抬得过高;但如果只停留在 AI 很神奇,「知其然,而不知其所以然」,就难以真正驾驭 AI 工具。「从直觉上理解」正是介于两者之间的中间态,既有可以推广的普遍适用性,也在应用中有很大的实用性。
最后需要说明的是,我并不支持鸡娃。学习应当建立在兴趣之上。如果孩子没有兴趣,以上内容就是纯扯谈。
-
来自 Google Research 2025 年末的一篇论文 Prompt Repetition Improves Non-Reasoning LLMs。原因是注意力是单向的,模型只看前文而不看后文,导致看问题前半部分时看不到后半部分。如果重复两遍,第二遍时看问题的前半部分就可以综合第一遍时问题的半部分,类似人类的回读。只对非思考模型有效,因为思考模型在思维链中会自己重复一遍。重复过多次会导致注意力涣散和减弱。 ↩
-
模型不会数数一般是并行概率拟合本身不擅长计数、加之重复数据可能出现的结构位置混淆导致的。但 strawberry 里有几个 r 确实是 tokenizer 的问题。 ↩
-
正确的做法是将拒绝的消息删除,然后重新发一遍 prompt。当然这个方法只对确实不该拒绝的情况有效,比如模型因为某些执念不想直接告诉你答案(非要你自己算)用这个方法可以解决,但模型如果因为请求违反伦理或政策而拒绝,就通常需要更复杂的破限方式。 ↩
-
DeepSeek 某个版本中,无上下文情况下发送
<think>可以获得模型对一个随机问题的推理过程。当时小红书就有好多人觉得是 DeepSeek “把其他人的回答发送给我了”“非常恐怖会不会是数据泄露”,而且这样的帖子能获得数千点赞。实际原因是模式诱导。广义上来说也是过拟合的一种(格式过拟合)。 ↩ -
也就是粉红大象效应。在 SOTA 模型中这个效应已经没有那么明显了,在大多数情况下他们可以很好地处理负向要求。但效果仍不如正向要求。一个有趣的现象是,如果你让 Gemini 3.6 Flash “绝不能使用 **** 来加粗文本,只能使用「」表示强调”时,它几乎是一定会毫不自知地违反规则。但如果你说的是“只使用「」表示强调。使用自然流畅的段落行文。”,它就能很好地执行。 ↩
-
本文发表后有人提出疑问。在此补充说明,这是他的自述,我未加修改。不过,无论能不能达到一些人心目中的「精通」标准,都不影响本文的论述逻辑链条的自洽性。 ↩