C.J*_*C.J 3 optimization artificial-intelligence machine-learning
考虑机器学习中带正则化的成本函数:
为什么会有参数?当我们设置参数时趋向于零?非常大?
正则化成本函数受到参数大小 ? 的惩罚。
正则化项在成本中占主导地位,以防万一 ? ? +inf
值得注意的是,什么时候?非常大,大部分成本将来自正则化项? * sum (?²)而不是实际成本sum((h_? - y)²),因此在这种情况下,主要是? * sum (?²)通过倾向于最小化正则化项?向 0 ( ? ? 0)
为什么最小化? * sum (?²)结果? ? 0
考虑正则化项? * sum (?²),要最小化该项,唯一的解决方案是 push sum(?²) ? 0。(?是一个正常数,sum项也是正数)
由于?项是平方的(?²总是正的),唯一的方法是将?参数推向 0。因此sum(?²) ? 0意味着? ? 0
总而言之,在这种非常大的情况下?:
最小化成本函数主要是关于最小化? * sum (?²),这需要最小化sum (?²),这需要? ? 0
一些直觉来回答评论中的问题:
考虑到 ?作为参数,您可以告诉您想要进行多少正则化。例如,如果您设置的极端?到 0,那么你的成本函数根本没有正则化。如果你设置?到一个较低的数字,那么你得到的正则化更少。
反之亦然,你增加的越多?,你越要求你的成本函数正则化,所以参数越小?必须是为了最小化正则化成本函数。
为什么我们在正则化和中使用 ?² 而不是 ??
因为目标是拥有小?(不太容易过拟合)。如果正则化项使用 ? 而不是总和中的 ?²,您最终可以得到大 ? 相互抵消的值,例如?_1 = 1000000 和?_2 = -1000001,sum(?)这里是-1,它很小,而如果你采用sum(|?|)(绝对值)或sum(?²)(平方),你最终会得到一个非常大的值。
在那种情况下,您最终可能会因为大 ? 因为这些项相互抵消而逃脱了正则化的值。