从零开始手撸大模型:损失函数从哪里来?从最大似然理解 MSE 与交叉熵。
在监督学习中,神经网络定义输入到输出的映射,损失函数则定义如何评价这组输出。回归常用均方误差,分类常用交叉熵,但这些公式并不只是一组经验搭配:它们可以从不同的条件概率模型中推导出来。 这条推导路径包含三个环节:为输出选择分布,让网络计算分布参数,再通过最大似然估计网络参数。分布不同,得到的负对数似然也不同。 下面讨论的是以负对数似然为训练目标的监督学习。它提供了一种系统的损失构造方法,但并不覆盖全部目标:当任务关心排序、间隔或特定决策代价时,也可能需要其他损失。 1. 从预测一个答案,到预测一个分布
|
| |||||||||||||||||||||||||


点击朱笔,直抒胸臆