百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

观察|深度学习为何强大?适当的神经网络架构+大数据

wptr33 2025-02-28 17:41 24 浏览

澎湃新闻记者 邵文

据Emergen Research分析称,到2028年,全球深度学习市场规模预计将以39.1%的稳定复合年增长率达到933.4亿美元,推动其市场收入的关键因素是采用基于云的技术和在大数据分析中使用深度学习系统。

那么,究竟什么是深度学习?它如何工作?

据《VentureBeat》在近日《这就是深度学习如此强大的原因》一文中总结道:深度学习是机器学习的一个子集,它使用神经网络来执行学习和预测。深度学习在各种任务中都表现出了惊人的表现,无论是文本、时间序列还是计算机视觉。深度学习的成功主要来自大数据的可用性和计算能力,这使得深度学习的表现远远优于任何经典的机器学习算法。

深度学习的本质:神经网络和函数

有网友曾笑言,“当你想要拟合任何函数或者任何分布,而又没有思路时,试试神经网络吧!”

先上两个重要结论:

神经网络是一个相互连接的神经元网络,每个神经元都是一个有限函数逼近器。这样,神经网络被视为通用函数逼近器。

深度学习是具有许多隐藏层(通常大于2个隐藏层)的神经网络。深度学习是从层到层的函数的复杂组合,从而找到定义从输入到输出的映射的函数。

在高中数学我们会学到,函数就是从输入空间到输出空间的映射。一个简单的sin(x)函数是从角空间(-180°到180°或0°到360°)映射到实数空间(-1到1)。函数逼近问题是函数论的重要组成部分,涉及的基本问题是函数的近似表示问题。

那么,为什么神经网络被认为是通用函数逼近器呢?

每个神经元学习一个有限的函数:f(.)=g(W*X)其中W是要学习的权重向量,X是输入向量,g(.)是非线性变换。W*X可以可视化为高维空间(超平面)中的一条线,而g(.)可以是任何非线性可微函数,如sigmoid、tanh、ReLU等(常用于深度学习领域)。

在神经网络中学习无非就是找到最佳权重向量W。例如,在y=mx+c中,我们有2个权重:m和c。现在,根据二维平面空间中点的分布,我们找到满足某些标准的m及c的最佳值,那么对于所有数据点,预测y和实际点之间的差异最小。

神经网络“层”效果:学习具体到类别概括的映射

如果输入是狮子的图像,输出是属于狮子类的图像分类,那么深度学习就是学习将图像向量映射到类的函数。类似地,输入是单词序列,输出是输入句子是否具有正面/中性/负面情绪。因此,深度学习是学习从输入文本到输出类的映射:中性或正面或负面。

如何实现上述任务呢?

每个神经元都是一个非线性函数,我们将几个这样的神经元堆叠在一个“层”中,每个神经元接收相同的一组输入但学习不同的权重W。因此,每一层都有一组学习函数:f1,f2,…,fn,称为隐藏层值。这些值再次组合,在下一层:h(f1,f2,...,fn)等等。这样,每一层都由前一层的函数组成(类似于h(f(g(x))))。已经表明,通过这种组合,我们可以学习任何非线性复函数

深度学习作为曲线拟合的插值:过度拟合挑战与泛化目标

深度学习先驱Yann LeCun(卷积神经网络的创造者和图灵奖获得者)曾在推特上发帖称,“深度学习并没有你想象的那么令人惊叹,因为它仅仅是美化曲线拟合的插值。但是在高维中,没有插值之类的东西。在高维空间,一切都是外推。”

插值(interpolation)是离散函数逼近的重要方法,利用它可通过函数在有限个点处的取值状况,估算出函数在其他点处的近似值。

从生物学的解释来看,人类通过逐层解释图像来处理世界的图像,从边缘和轮廓等低级特征,到对象和场景等高级特征。神经网络中的函数组合与此一致,其中每个函数组合都在学习关于图像的复杂特征。用于图像最常见的神经网络架构是CNN(Convolutional Neural Networks,卷积神经网络),它以分层方式学习这些特征,然后一个完全连接的神经网络将图像特征分类为不同的类别。

比如,给定一组平面上的数据点,我们尝试通过插值拟合曲线,该曲线在某种程度上代表了定义这些数据点的函数。我们拟合的函数越复杂(例如在插值中,通过多项式次数确定),它就越适合数据;但是,它对新数据点的泛化程度越低。

这就是深度学习面临挑战的地方,也就是通常所说的过度拟合问题:尽可能地拟合数据,但在泛化方面有所妥协。几乎所有深度学习架构都必须处理这个重要因素,才能学习在看不见的数据上表现同样出色的通用功能。

深度学习如何学习?问题决定了神经网络架构

那么,我们如何学习这个复杂的函数呢?

这完全取决于手头的问题,其决定了神经网络架构。如果我们对图像分类感兴趣,那么我们使用CNN。如果我们对时间相关的预测或文本感兴趣,那么我们使用RNN(Recurrent Neural Network,循环神经网络) 或Transformer,如果我们有动态环境(如汽车驾驶),那么我们使用强化学习。

除此之外,学习还涉及处理不同的挑战:

·通过使用正则化(regularization,用来防止训练的模型产生过拟合与欠拟合现象)处理确保模型学习通用函数,而不仅仅适合训练数据。

·根据手头的问题,选择损失函数。粗略地说,损失函数是我们想要的(真实值)和我们当前拥有的(当前预测)之间的误差函数。

·梯度下降是用于收敛到最优函数的算法。决定学习率变得具有挑战性,因为当我们远离最优时,我们想要更快地走向最优,而当我们接近最优时,我们想要慢一些,以确保我们收敛到最优和全局最小值。

·大量隐藏层需要处理梯度消失问题。跳过连接和适当的非线性激活函数等架构变化,有助于解决这个问题。

基于神经架构与大数据:深度学习带来计算挑战

现在我们知道深度学习只是一个学习复杂的函数,它带来了其他计算挑战:

要学习一个复杂的函数,我们需要大量的数据;为了处理大数据,我们需要快速的计算环境;因此,我们需要一个支持这种环境的基础设施。

使用CPU进行并行处理不足以计算数百万或数十亿的权重(也称为DL的参数)。神经网络需要学习需要向量(或张量)乘法的权重。这就是GPU派上用场的地方,因为它们可以非常快速地进行并行向量乘法。根据深度学习架构、数据大小和手头的任务,我们有时需要1个GPU,有时,数据科学家需要根据已知文献或通过测量1个GPU的性能来做出决策。

通过使用适当的神经网络架构(层数、神经元数量、非线性函数等)以及足够大的数据,深度学习网络可以学习从一个向量空间到另一个向量空间的任何映射。这就是让深度学习成为任何机器学习任务的强大工具的原因。

责任编辑:李跃群

校对:丁晓

相关推荐

oracle数据导入导出_oracle数据导入导出工具

关于oracle的数据导入导出,这个功能的使用场景,一般是换服务环境,把原先的oracle数据导入到另外一台oracle数据库,或者导出备份使用。只不过oracle的导入导出命令不好记忆,稍稍有点复杂...

继续学习Python中的while true/break语句

上次讲到if语句的用法,大家在微信公众号问了小编很多问题,那么小编在这几种解决一下,1.else和elif是子模块,不能单独使用2.一个if语句中可以包括很多个elif语句,但结尾只能有一个else解...

python continue和break的区别_python中break语句和continue语句的区别

python中循环语句经常会使用continue和break,那么这2者的区别是?continue是跳出本次循环,进行下一次循环;break是跳出整个循环;例如:...

简单学Python——关键字6——break和continue

Python退出循环,有break语句和continue语句两种实现方式。break语句和continue语句的区别:break语句作用是终止循环。continue语句作用是跳出本轮循环,继续下一次循...

2-1,0基础学Python之 break退出循环、 continue继续循环 多重循

用for循环或者while循环时,如果要在循环体内直接退出循环,可以使用break语句。比如计算1至100的整数和,我们用while来实现:sum=0x=1whileTrue...

Python 中 break 和 continue 傻傻分不清

大家好啊,我是大田。今天分享一下break和continue在代码中的执行效果是什么,进一步区分出二者的区别。一、continue例1:当小明3岁时不打印年龄,其余年龄正常循环打印。可以看...

python中的流程控制语句:continue、break 和 return使用方法

Python中,continue、break和return是控制流程的关键语句,用于在循环或函数中提前退出或跳过某些操作。它们的用途和区别如下:1.continue(跳过当前循环的剩余部分,进...

L017:continue和break - 教程文案

continue和break在Python中,continue和break是用于控制循环(如for和while)执行流程的关键字,它们的作用如下:1.continue:跳过当前迭代,...

作为前端开发者,你都经历过怎样的面试?

已经裸辞1个月了,最近开始投简历找工作,遇到各种各样的面试,今天分享一下。其实在职的时候也做过面试官,面试官时,感觉自己问的问题很难区分候选人的能力,最好的办法就是看看候选人的github上的代码仓库...

面试被问 const 是否不可变?这样回答才显功底

作为前端开发者,我在学习ES6特性时,总被const的"善变"搞得一头雾水——为什么用const声明的数组还能push元素?为什么基本类型赋值就会报错?直到翻遍MDN文档、对着内存图反...

2023金九银十必看前端面试题!2w字精品!

导文2023金九银十必看前端面试题!金九银十黄金期来了想要跳槽的小伙伴快来看啊CSS1.请解释CSS的盒模型是什么,并描述其组成部分。答案:CSS的盒模型是用于布局和定位元素的概念。它由内容区域...

前端面试总结_前端面试题整理

记得当时大二的时候,看到实验室的学长学姐忙于各种春招,有些收获了大厂offer,有些还在苦苦面试,其实那时候的心里还蛮忐忑的,不知道自己大三的时候会是什么样的一个水平,所以从19年的寒假放完,大二下学...

由浅入深,66条JavaScript面试知识点(七)

作者:JakeZhang转发链接:https://juejin.im/post/5ef8377f6fb9a07e693a6061目录由浅入深,66条JavaScript面试知识点(一)由浅入深,66...

2024前端面试真题之—VUE篇_前端面试题vue2020及答案

添加图片注释,不超过140字(可选)1.vue的生命周期有哪些及每个生命周期做了什么?beforeCreate是newVue()之后触发的第一个钩子,在当前阶段data、methods、com...

今年最常见的前端面试题,你会做几道?

在面试或招聘前端开发人员时,期望、现实和需求之间总是存在着巨大差距。面试其实是一个交流想法的地方,挑战人们的思考方式,并客观地分析给定的问题。可以通过面试了解人们如何做出决策,了解一个人对技术和解决问...