新 闻 → 科教                                             

从零开始:手撸大模型
IT技术小密圈 | 2026-09-29  

声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ]
赞助信息

从零开始手撸大模型:损失函数从哪里来?从最大似然理解 MSE 与交叉熵。

点击图片看原样大小图片点
击
图
片
看
原
图

在监督学习中,神经网络定义输入到输出的映射,损失函数则定义如何评价这组输出。回归常用均方误差,分类常用交叉熵,但这些公式并不只是一组经验搭配:它们可以从不同的条件概率模型中推导出来。

这条推导路径包含三个环节:为输出选择分布,让网络计算分布参数,再通过最大似然估计网络参数。分布不同,得到的负对数似然也不同。

下面讨论的是以负对数似然为训练目标的监督学习。它提供了一种系统的损失构造方法,但并不覆盖全部目标:当任务关心排序、间隔或特定决策代价时,也可能需要其他损失。

1. 从预测一个答案,到预测一个分布

点击图片看原样大小图片点
击
图
片
看
原
图

您的观点至关重要

点击朱笔,直抒胸臆

By Google

    © 2026    八阕之地™ by Towards Digital Group关于我们 | 反馈意见 | 业务合作 | 八阕书局 | 隐私政策 | 使用条款  
从零开始:手撸大模型