跳到正文
有点来电UNBOUND EDITION
目录
档案目录 05
本文大纲 03

F-003 / 笔记

url

用一个最小例子理解梯度、学习率与迭代更新。

当我们希望找到函数 f(x)f(x) 的最小值时,可以沿着梯度的反方向移动。

更新规则

最基本的迭代形式是:

xt+1=xtηf(xt)x_{t+1} = x_t - \eta \nabla f(x_t)

其中 η\eta 是学习率。它决定每一步走多远:太小会让收敛变慢,太大则可能跨过最优点。

一个二次函数

f(x)=(x3)2f(x) = (x-3)^2,那么 f(x)=2(x3)\nabla f(x)=2(x-3)。从 x0=0x_0=0 开始,取 η=0.1\eta=0.1,每一次更新都会更接近 x=3x=3

迭代xxf(x)f(x)
00.009.00
10.605.76
21.083.69

MARGINALIA / 页边批注

留下你的批注

这里的留言只属于本篇文章。欢迎记下疑问、补充、异议,或阅读时闪过的念头。

正在翻开本页批注…

END OF NOTE · 返回博客目录