跳到实验

别先背公式,先看它真的学会

让一个小网络
自己学会 XOR

四条数据、十三个可学习参数、一个答案。训练时你会亲眼看到:预测犯错 → 计算 Loss → 修改权重 → 下一次少错一点。

输入 两个数字 参数 13 个旋钮 输出 0 到 1 的概率

LIVE NETWORK

网络内部正在发生什么

训练步数 0 平均 Loss 0.0000 准确率 0%
两输入、四隐藏神经元和一个输出神经元组成的网络 连线颜色表示权重正负,粗细表示权重绝对值,节点亮度表示当前激活值。
正权重:推动输出升高 负权重:压低输出 线越粗:影响越大
01 / 数据 先给网络四道题

XOR 的规则是“两者不同就输出 1,相同就输出 0”。程序只提供题目和答案,没有把这条规则写进网络。

DECISION MAP

它认为哪里更像答案 1?

四个角是训练题;青色越亮,输出越接近 1。

LOSS HISTORY

错误有没有真的下降?

曲线下降,表示网络对四道题的整体预测更接近答案。

FROM 13 PARAMETERS TO BILLIONS

这个小实验,放大后就是大模型的基本骨架

DeepSeek 当然复杂得多,但“输入 → 参数计算 → 概率 → 错误 → 更新参数”这条主线没有变。

这里2 个数字大模型一串 Token
这里13 个参数大模型几十亿到数千亿参数
这里输出 0/1 概率大模型输出下一个 Token 的概率
这里学 XOR 四条数据大模型学习海量文字、代码和知识模式

你现在只要记住

神经网络不是把规则存进状态机,而是把经验压进许多数字参数;生成答案时,这些参数一起把输入变成下一步的概率。