sklearn Logistic回归中的C参数是什么?

Abd*_*awy 19 python machine-learning scikit-learn logistic-regression overfitting-underfitting

C中的参数是什么意思sklearn.linear_model.LogisticRegression?它如何影响决策边界?高值会使C决策边界非线性吗?如果我们可视化决策边界,逻辑回归的过度拟合会是什么样子?

Acc*_*ion 23

从文档中:

C:浮点数,默认=1.0 正则化强度的倒数;必须是正浮动。与支持向量机一样,较小的值指定更强的正则化。

如果您不明白这一点,交叉验证可能是比这里更好的地方。

虽然 CS 人员经常将函数的所有参数称为“参数”,但在机器学习中,C 被称为“超参数”。参数是告诉模型如何处理特征的数字,而超参数则告诉模型如何选择参数。

正则化通常指的是对于更极端的参数应该有复杂度惩罚的概念。这个想法是,只查看训练数据而不注意参数的极端程度会导致过度拟合。C 值越高,告诉模型对训练数据给予高权重,对复杂性惩罚给予较低权重。较低的值告诉模型对这种复杂性惩罚给予更多的权重,但以拟合训练数据为代价。基本上,高 C 意味着“非常信任这个训练数据”,而低值表示“这个数据可能无法完全代表现实世界的数据,所以如果它告诉你将参数设置得非常大,请不要听到它”。

https://en.wikipedia.org/wiki/Regularization_(数学)