1950 图灵测试
什么叫思考?机器能思考吗?
图灵没有纠结哲学定义,而是换了个更工程化的问法:
如果一台机器隔着屏幕和你聊天,聊到你分不清对面是人还是机器,那这台机器算不算学会了思考?
这是图灵测试。一个简单但至今仍在被讨论的标准。
1956 达特茅斯会议 —— AI 正式诞生
约翰·麦卡锡 给这个学科起了名字:Artificial Intelligence(人工智能)。
当时一群人乐观地觉得:一个夏天,加足够的经费,就能搞出通用人工智能(AGI)。后来回头看,当然是太天真了。
两条路线从此分野(但能否重聚?)
符号主义:人类手写规则和知识,用逻辑推理。好处是清晰可解释,问题是规则永远写不完。
连接主义:1958 年罗森布拉特搞出了感知机(Perceptron)——深度学习的祖宗。想法是用数学模型模拟神经元。(MLP、ReLu)
但当时缺数据、缺算力,算法也还很初级。
1969 第一次 AI 寒冬
马文·明斯基 从数学上证明了:单层感知机连 XOR(异或)这种简单问题都解决不了。
神经网络路线被否定,投资中断,行业进入长达十年的寒冬。
中间也有一些进展(1966 年第一个聊天机器人 ELIZA、1968 年首个专家系统 DENDRAL),但整体上 AI 进入低潮。
1980 年代 专家系统 —— 第二次高潮
换了个思路:找来行业顶尖专家,把他们的经验写成规则,做成「专家系统」。
80 年代初还是挺成功的,比如 DEC 公司的 XCON 系统每年能省四千万美元。
1986 反向传播算法 —— 辛顿的关键贡献
辛顿(Geoffrey Hinton) 等人推广了反向传播算法(BP),让多层神经网络可以训练了。本质是:机器根据输出和正确答案的差距,反向调整每一层的权重——机器学会了自己纠错。
辛顿后来被称为「深度学习之父」,2024 年拿了诺贝尔物理学奖。
同年,杨立昆(Yann LeCun) 搞出了卷积神经网络(CNN),用来识别手写数字。
1980 年代末 第二次 AI 寒冬
专家系统的老问题:规则越写越多、维护困难、缺乏泛化能力。1987 年市场崩盘,AI 又凉了。
复苏:算法、算力、数据三大要素慢慢凑齐
算法
除了前面说的 BP 和 CNN,1997 年又有了 LSTM(长短期记忆网络),解决了序列数据的梯度消失问题,是后来 NLP 革命的基础。
残差网络等等等 算法结构整活ing,LSTM看到了序列历史的重要性,未能充分解决并行问题
数据
李飞飞 2009 年搞了 ImageNet——超大规模图像数据集,1400 万张图片。没有这个,深度学习根本没东西可学。
算力
英伟达的 GPU。并行计算天然适合神经网络的矩阵运算,后来成了 AI 时代的「金铲子」。
中间还有一些重要节点:1997 年 IBM 深蓝击败国际象棋冠军(暴力穷举的巅峰,不是学习),2006 年辛顿正式提出深度学习概念。
2012 AlexNet —— 转折点
辛顿带着两个学生 伊利亚(后来 OpenAI 首席科学家)和 亚历克斯,用 GPU 训练了一个 CNN 模型 AlexNet,参加 ImageNet 比赛。
结果:断崖式碾压所有传统方法,错误率从 26% 暴降到 15%。
这件事一下验证了三件事:
- 神经网络这条路是对的,只是以前条件不够
- 大数据集是真的必要
- GPU 算力就是金矿
2016 AlphaGo —— 出圈
AlphaGo 4:1 赢李世石。架构是深度神经网络 + 蒙特卡洛树搜索 + 强化学习。
围棋的变化比宇宙原子数还多,没法穷举、没法写规则。AlphaGo 证明了「学习」比「规则」强。
2017 年的 AlphaGo Zero 更离谱——完全从零自我博弈,不学人类棋谱,自己发现了围棋策略,有的甚至连人类几千年都没走出来过。
2017 – 2020 技术积累期
几个我觉得重要的:
- 2017 Transformer:Google 提出的架构,「Attention is All You Need」,后来几乎所有大模型的基础
- 2018 BERT:NLP 进入「预训练 + 微调」范式
- 2020 GPT-3:OpenAI 的 1750 亿参数模型,展示了涌现能力——不用专门训练就能做翻译、写作、写代码
... GPT泰酷辣
2022 ChatGPT —— 机器思考和灵魂的涌现
ChatGPT 两个月用户破亿。普通人第一回直观感受到 AI 能对话、能写作、能推理。
从此 AI 从定制化技术变成了大众产品,生成式 AI时代正式开启。
之后就是大模型军备竞赛:GPT-4、llama、文心一言、智谱、千问、DeepSeek、kimi,以及各种 AI 原生应用。
多模态正在崭露头角,GPT4o,能看图,能听说,效果远超传统ASR/TTS文本语音互转。
下一步是什么,强化学习、agent?
