AI 小记 重走人工智能发展史


1950 图灵测试

什么叫思考?机器能思考吗?

图灵没有纠结哲学定义,而是换了个更工程化的问法:

如果一台机器隔着屏幕和你聊天,聊到你分不清对面是人还是机器,那这台机器算不算学会了思考?

这是图灵测试。一个简单但至今仍在被讨论的标准。


1956 达特茅斯会议 —— AI 正式诞生

约翰·麦卡锡 给这个学科起了名字:Artificial Intelligence(人工智能)

当时一群人乐观地觉得:一个夏天,加足够的经费,就能搞出通用人工智能(AGI)。后来回头看,当然是太天真了。

两条路线从此分野(但能否重聚?)

符号主义:人类手写规则和知识,用逻辑推理。好处是清晰可解释,问题是规则永远写不完。

连接主义:1958 年罗森布拉特搞出了感知机(Perceptron)——深度学习的祖宗。想法是用数学模型模拟神经元。(MLP、ReLu)

但当时缺数据、缺算力,算法也还很初级。


1969 第一次 AI 寒冬

马文·明斯基 从数学上证明了:单层感知机连 XOR(异或)这种简单问题都解决不了。

神经网络路线被否定,投资中断,行业进入长达十年的寒冬。

中间也有一些进展(1966 年第一个聊天机器人 ELIZA、1968 年首个专家系统 DENDRAL),但整体上 AI 进入低潮。


1980 年代 专家系统 —— 第二次高潮

换了个思路:找来行业顶尖专家,把他们的经验写成规则,做成「专家系统」。

80 年代初还是挺成功的,比如 DEC 公司的 XCON 系统每年能省四千万美元。

1986 反向传播算法 —— 辛顿的关键贡献

辛顿(Geoffrey Hinton) 等人推广了反向传播算法(BP),让多层神经网络可以训练了。本质是:机器根据输出和正确答案的差距,反向调整每一层的权重——机器学会了自己纠错

辛顿后来被称为「深度学习之父」,2024 年拿了诺贝尔物理学奖。

同年,杨立昆(Yann LeCun) 搞出了卷积神经网络(CNN),用来识别手写数字。

1980 年代末 第二次 AI 寒冬

专家系统的老问题:规则越写越多、维护困难、缺乏泛化能力。1987 年市场崩盘,AI 又凉了。


复苏:算法、算力、数据三大要素慢慢凑齐

算法

除了前面说的 BP 和 CNN,1997 年又有了 LSTM(长短期记忆网络),解决了序列数据的梯度消失问题,是后来 NLP 革命的基础。

残差网络等等等 算法结构整活ing,LSTM看到了序列历史的重要性,未能充分解决并行问题

数据

李飞飞 2009 年搞了 ImageNet——超大规模图像数据集,1400 万张图片。没有这个,深度学习根本没东西可学。

算力

英伟达的 GPU。并行计算天然适合神经网络的矩阵运算,后来成了 AI 时代的「金铲子」。

中间还有一些重要节点:1997 年 IBM 深蓝击败国际象棋冠军(暴力穷举的巅峰,不是学习),2006 年辛顿正式提出深度学习概念。


2012 AlexNet —— 转折点

辛顿带着两个学生 伊利亚(后来 OpenAI 首席科学家)和 亚历克斯,用 GPU 训练了一个 CNN 模型 AlexNet,参加 ImageNet 比赛。

结果:断崖式碾压所有传统方法,错误率从 26% 暴降到 15%。

这件事一下验证了三件事:

  1. 神经网络这条路是对的,只是以前条件不够
  2. 大数据集是真的必要
  3. GPU 算力就是金矿

2016 AlphaGo —— 出圈

AlphaGo 4:1 赢李世石。架构是深度神经网络 + 蒙特卡洛树搜索 + 强化学习

围棋的变化比宇宙原子数还多,没法穷举、没法写规则。AlphaGo 证明了「学习」比「规则」强。

2017 年的 AlphaGo Zero 更离谱——完全从零自我博弈,不学人类棋谱,自己发现了围棋策略,有的甚至连人类几千年都没走出来过。


2017 – 2020 技术积累期

几个我觉得重要的:

  • 2017 Transformer:Google 提出的架构,「Attention is All You Need」,后来几乎所有大模型的基础
  • 2018 BERT:NLP 进入「预训练 + 微调」范式
  • 2020 GPT-3:OpenAI 的 1750 亿参数模型,展示了涌现能力——不用专门训练就能做翻译、写作、写代码

... GPT泰酷辣


2022 ChatGPT —— 机器思考和灵魂的涌现

ChatGPT 两个月用户破亿。普通人第一回直观感受到 AI 能对话、能写作、能推理。

从此 AI 从定制化技术变成了大众产品,生成式 AI时代正式开启。

之后就是大模型军备竞赛:GPT-4、llama、文心一言、智谱、千问、DeepSeek、kimi,以及各种 AI 原生应用。

多模态正在崭露头角,GPT4o,能看图,能听说,效果远超传统ASR/TTS文本语音互转。

下一步是什么,强化学习、agent?