Featured image of post AI的核心:深度学习的运作机制 - 神经网络如何进行学习

AI的核心:深度学习的运作机制 - 神经网络如何进行学习

「深度学习(Deep Learning)」是引发第三次AI热潮的导火索,也是ChatGPT等技术的基础。本文将为您解说模仿人类脑神经的算法是如何自行发现特征的。

1. 深度学习之前的AI(机器学习)的局限性

「AI(人工智能)」这个词由来已久,但在其进化的过程中曾遇到过巨大的壁垒。 在传统的AI(传统的机器学习)中,为了让其判断图像中是「猫」还是「狗」, 人类需要告诉AI「应该关注的特征」 。例如「耳朵是否尖锐」、「是否长着胡须」等特征(特征量)需要人类进行编程,AI再基于这些特征进行判别。

然而,人类定义所有特征是有极限的。打破这个「特征量设计的壁垒」,实现了 「只要提供大量数据,AI就能自己找出特征」 这一突破的,正是 「深度学习(Deep Learning)」

2. 模仿人类大脑的「神经网络」

深度学习的基础是一种被称为「 神经网络 」的算法,它在数学上模仿了人类大脑的神经细胞(神经元)的网络。

人类的大脑在视觉信息从眼睛进入后,神经元会接连不断地传递信息,从而识别出「这是一只猫」。在计算机上重现这一过程的结构如下:

  graph LR
    Input["输入层 (Input Layer)"] --> Hidden1["隐藏层 1"]
    Hidden1 --> Hidden2["隐藏层 2"]
    Hidden2 --> Hidden3["隐藏层 3..."]
    Hidden3 --> Output["输出层 (Output Layer)"]
  1. 输入层 : 接收图像的像素数据等原始数据。
  2. 隐藏层(中间层) : 提取和处理数据特征的层。
  3. 输出层 : 得出最终结论(例如「99%的概率是猫」)。

将这种隐藏层(中间层)「 深入地(Deep地)叠加很多层 」的结构,被称为深度学习。

3. 为什么AI能够「学习」?(权重和误差反向传播法)

在神经网络中,各个神经元之间用线连接,这些连接都设定了一个被称为「 权重(Weight) 」的数值。这个「权重」正是AI「智能」的真面目。

学习的步骤(误差反向传播法:Backpropagation)

  1. 给AI看「猫的图像」。一开始因为「权重」是随机的,AI会随意计算并给出「是狗」的错误答案。
  2. 计算正确答案(猫)与AI给出的答案(狗)之间的「 误差(错误的大小) 」。
  3. 将这个误差的信息,从输出层向输入层 反向地 反馈。
  4. 利用「如果当时把这个权重稍微调低一点,应该就能更接近正确答案了」这种数学上的微积分(梯度下降法), 对网络整体的「权重」进行微调

将这1到4的步骤,使用几百万张图像重复几万次(这就是「学习」)。于是,网络的「权重」会逐渐被优化,最终诞生出「即使看到未知的图像,也能准确判别出是猫」的聪明AI。

4. GPU的进化唤醒了深度学习

实际上,神经网络和误差反向传播法的理论本身从1980年代就已经存在了。但在当时,因为「如果增加层数计算量就会呈爆炸性增长,当时的计算机无法处理」,这些理论被抛弃了。

2012年,唤醒这一沉睡理论的是「 GPU(显卡) 」和「 大数据 」。 本来是为了渲染3D游戏画面的部件GPU,其设计是「用数千个核心一口气并行处理简单的矩阵乘法」。这与神经网络中庞大的乘法处理完美契合。通过大量使用NVIDIA公司的GPU,过去需要花费数月时间的学习在几天内就能完成,从而引爆了第三次AI热潮。

5. 从图像识别到「生成式AI(LLM)」的进化

深度学习最初在「图像识别(CNN)」领域取得了巨大成果。随后,在「语音识别」和「翻译(RNN)」等领域也达到了超越人类的精度。

而现在,基于这种深度学习发展而来的被称为「Transformer」的架构登场了,它学习了互联网上庞大的文本数据,诞生了巨大的神经网络。这就是「 大型语言模型(LLM) 」,也是我们日常使用的 ChatGPT 等「生成式AI」的真面目。

6. 总结

深度学习是由受到人类大脑机制启发的算法,与现代压倒性的计算资源(GPU)相结合而诞生的技术。 不是「为AI编写得出正确答案的逻辑」,而是「让AI自己从数据中找出逻辑(权重)」,这种范式转换作为IT历史上最重要的革命之一,此刻正试图重塑整个社会。

comments powered by Disqus