有趣生活

当前位置:首页>科技>深度学习宽度与高度为什么深度学习是非参数的

深度学习宽度与高度为什么深度学习是非参数的

发布时间:2026-07-21阅读(1)

导读作者丨ThomasViehmann编译丨钱磊编辑丨陈彩娴今天我想要与大家分享的是深度神经网络的工作方式,以及深度神经与“传统”机器学习模型的不同之处。我的计....

作者丨Thomas Viehmann

编译丨钱磊

编辑丨陈彩娴

今天我想要与大家分享的是深度神经网络的工作方式,以及深度神经与“传统”机器学习模型的不同之处。我的计划具体如下:

  • 首先简单地思考一下如何将问题设置成分类的形式;

  • 接下来回顾偏差-方差分解,并在偏差-方差权衡的背景下,在VC-维数和非参数上进行探讨;

  • 研究一些关于插值神经网络和双下降的文献;

  • 在文末做一个非常简单的实验,用图形直观地讲解为什么双下降现象会发生。

1

正式设置一个机器学习问题

为了有些趣味,让我们先设置一个问题。

首先从数据开始。假设我们标记了数据,即是满足Px,y分布的输入数据x(比如图片)和标签y

如此一来我们得到:

分布Px,y固定且未知。对于i = 1……N来说,可获得样本

,

数学分析通常假设样本是独立的。

通常来说,我们需要假设标签y和输入x间有y=

的函数关系,即是说,标签是精确的、没有歧义的,但并非总是如此。我们想要“训练”的是某些函数f:xy,或者说是更普遍地估计条件分布P(yx)。我们的候选函数来自于参数集F={θ∈Θ},在这里θ代表参数。为了达成目标,我们设定了损失函数(或风险函数),从概念上讲,我们希望将预期损失

最小化。

第一次尝试通常是将经验风险或者经验损失

最小化。如果我们的损失函数是负对数似然,将

最最小化就意味着计算最大相似估计。

对偏差-方差分解和偏差-方差平衡的简单介绍

对于最小二乘损失L=(f(x)−y)

Copyright © 2024 有趣生活 All Rights Reserve吉ICP备19000289号-5 TXT地图HTML地图XML地图