配音

什么是人工智能

课程简介

AI 的基本概念、发展历史与当今应用全景。

🎬 本课程视频:AI For Everyone — 给所有人的 AI 课


什么是人工智能:概念、历史与当代应用全景

一、AI 的定义:不只是"智能"

人工智能(Artificial Intelligence)指的是让计算机系统能够执行通常需要人类智能才能完成的任务的能力。但"智能"这个词本身就很模糊,我们需要更精确的定义。

从技术角度看,AI 系统通过感知环境、理解信息、做出决策和采取行动来实现特定目标。衡量一个系统是否"智能"的方式是看它能否在不确定性的环境中持续做出好的决策。

一个重要的区分:强人工智能(AGI,Artificial General Intelligence)指的是能像人类一样解决任何智力问题的系统,今天还不存在。弱人工智能(Narrow AI)指的是在特定任务上表现出色的系统——面部识别、语音识别、机器翻译、游戏博弈等——今天所有 AI 都属于这一类。

二、AI 的三次浪潮

理解 AI 的发展历史有助于理解它的现状和未来方向。

第一次浪潮:符号主义(1950s-1980s)

规则驱动的 AI。核心思想是:智能可以被编码为一组明确的逻辑规则。如果输入满足条件 A 和条件 B,就执行操作 C。这一时期产生了专家系统——将领域专家的知识编码为 if-then 规则的系统。

典型例子:MYCIN(1970s)——医学诊断专家系统,能根据症状和化验结果诊断血液感染,推荐抗生素治疗方案。在某些测试中它的诊断准确率甚至超过了初级医生。

局限:规则系统在面对现实世界的模糊性和不确定性时很快崩塌。如果需要 10 条规则才能描述一个简单问题,10 万条规则也写不完一个复杂领域的完整知识库。

第二次浪潮:统计学习/机器学习(1990s-2010s)

数据驱动的 AI。核心思想是:不再手工编写规则,而是从大量数据中自动学习模式和规律。收集海量标注数据 → 选择合适的算法 → 在数据上训练模型 → 用训练好的模型预测新数据。

关键里程碑:2006 年 Geoffrey Hinton 提出深度信念网络的有效训练方法,开启了深度学习革命。2012 年 AlexNet 在 ImageNet 图像识别比赛上以压倒性优势获胜,错误率从 26% 骤降到 16%,宣告深度学习时代的到来。

这一时期,AI 在语音识别(2016 年达到人类水平)、图像分类(2015 年超越人类)、机器翻译、推荐系统、棋类博弈(2016 年 AlphaGo 击败李世石)等领域取得了突破性进展。

第三次浪潮:生成式 AI 与基础模型(2020s-至今)

2020 年以来,以 GPT-3、DALL-E、Stable Diffusion、Claude 为代表的生成式 AI 模型带来了范式转变。核心变化在于:
1. 规模驱动:模型参数量从亿级跃升到千亿级,训练数据从特定领域扩展到互联网级
2. 通用性提升:同一个模型可以完成写文章、编程、翻译、推理等多种任务
3. 交互方式变革:自然语言成为主要交互界面

2022 年底 ChatGPT 的发布是标志性事件——两个月内用户破亿,成为历史上增长最快的消费级应用。

三、当代 AI 的应用全景

今天 AI 已经渗透到各行各业:

四、AI 不是魔法

最后我想强调一点:AI 不是魔法,它是统计学。每一个"智能"行为的背后,是数学模型在大量数据上发现的相关性。理解这一点有助于我们合理评估 AI 的能力和局限。AI 擅长的是从历史数据中发现模式,并用这些模式去预测未来——但如果未来和历史不同,模型就会失效。

五、总结

AI 从 1950 年代发展至今经历了符号主义、机器学习、生成式 AI 三次浪潮。今天的 AI 是弱人工智能——在特定领域表现出色,但不具备通用智能。理解 AI 的本质——统计模式匹配——是合理使用 AI 的第一步。

六、AI 的关键技术分支

理解 AI 不仅要了解它的历史,还需要了解当代 AI 的几个关键技术分支:

6.1 计算机视觉

计算机视觉让计算机"看懂"图像和视频。核心技术包括图像分类(这张图里是什么?)、目标检测(图里的物体在什么位置?)、语义分割(每个像素属于什么类别?)、姿态估计(人的关节位置?)。

应用场景:自动驾驶(检测行人、车辆、交通标志)、医疗影像诊断(从 X 光、CT、MRI 中检测病灶)、工业质检(检测生产线上的产品缺陷)。关键模型架构包括 CNN(卷积神经网络)、ResNet、YOLO、Vision Transformer。

6.2 自然语言处理

NLP 让计算机理解和生成人类语言。核心技术包括文本分类(情感分析、垃圾邮件检测)、命名实体识别(抽取人名、地名、组织名)、机器翻译、文本摘要、问答系统。

重要里程碑:2018 年 BERT 发布,开启了预训练语言模型时代。2020 年 GPT-3 将参数提升到 1750 亿,展现了令人惊讶的零样本学习能力。今天的 CLAUDE、GPT-4、Gemini 已经具备了接近人类水平的对话能力。

6.3 语音技术

语音技术包括自动语音识别(ASR)——将语音转为文字、语音合成(TTS)——将文字转为语音、说话人识别——辨认说话人身份。当今主流方案采用端到端的深度学习模型,如 Whisper、WaveNet、FastSpeech。

6.4 推荐系统

推荐系统在电商、内容平台中无处不在。核心技术包括协同过滤("喜欢这个商品的人也喜欢……")、基于内容的推荐("和你之前喜欢的东西相似")、深度学习推荐(利用用户行为序列建模)。推荐系统的核心挑战:冷启动问题(新用户新商品没有行为数据)、探索与利用的平衡(既要推荐已知用户喜欢的,也要尝试新内容)。

七、AI 项目的生命周期

理解 AI 项目的完整生命周期有助于合理规划和管理 AI 项目:

  1. 问题定义:明确业务目标和成功指标。不是"用 AI 做什么",而是"解决什么业务问题"
  2. 数据准备:收集、标注、清洗、验证数据。这是最耗时的环节,通常占项目 60-80% 的时间
  3. 模型开发:选择算法、训练模型、调优超参、评估效果
  4. 部署:将模型部署到生产环境,搭建推理 API 或批处理管道
  5. 监控与迭代:持续监控模型效果,检测数据漂移,定期重新训练

八、AI 时代的学习路径建议

最后给希望深入 AI 领域的朋友一些学习路径建议:

  1. 数学基础:线性代数(矩阵运算是关键)、概率统计(理解不确定性)、微积分(梯度下降的基础)
  2. 编程基础:Python 是 AI 领域的通用语言,建议熟练掌握 NumPy、Pandas 等数据处理库
  3. 机器学习基础:从经典的 scikit-learn 开始,理解监督学习和无监督学习的核心算法
  4. 深度学习:学习 PyTorch 或 TensorFlow,理解神经网络、CNN、RNN、Transformer
  5. 实战项目:做实际项目是学习 AI 的最佳方式——从简单的分类任务开始,逐步挑战更复杂的问题
  6. 持续跟进:AI 领域发展极快,建议关注 ArXiv、顶级会议论文(NeurIPS、ICML、CVPR、ACL)和行业博客

九、AI 的伦理思考框架

在学习和使用 AI 的过程中,保持伦理意识至关重要。一个简单的伦理思考框架:

这个 AI 系统是否公平?——它是否对所有用户群体一视同仁?训练数据是否包含了足够的多样性?

这个 AI 系统是否透明?——用户知道自己在和 AI 交互吗?系统能不能解释自己的决策?

这个 AI 系统是否尊重隐私?——它收集了什么数据?数据存储在哪里?用户能不能控制自己的数据?

这个 AI 系统是否安全?——它会不会被恶意使用?如果出错会产生什么后果?有没有故障降级机制?

谁对这个 AI 系统负责?——出了问题谁承担责任?有没有清晰的问责机制?

学习 AI 不仅是学会使用工具,更是学会负责任地使用工具。技术能力越强,责任就越大。

十、AI 发展史上的里程碑时刻

了解 AI 的历史有助于理解为什么今天 AI 突然变得如此强大。以下是几个关键的里程碑:

1997 年——深蓝击败国际象棋世界冠军:IBM 的深蓝通过暴力搜索和评估函数击败了卡斯帕罗夫。这是机器在智力活动中首次击败人类世界冠军。但深蓝的方法——搜索 + 手工规则——不是现代意义上的机器学习。

2011 年——沃森在 Jeopardy! 中获胜:IBM 沃森展示了自然语言处理和知识检索的能力。它不需要访问互联网,而是基于大量文本训练。这是 NLP 系统的早期成功。

2012 年——AlexNet 在 ImageNet 上的突破:这是深度学习革命的开端。Alex Krizhevsky 用 GPU 训练的卷积神经网络在图像分类竞赛中大幅领先传统方法——错误率从 26% 降到 16%。这个结果让整个 AI 社区认识到深度学习的潜力。

2016 年——AlphaGo 击败李世石:DeepMind 的 AlphaGo 在围棋这个人类智力的最后堡垒中击败了世界冠军。更引人注目的是第 37 手——一个人类棋手几乎不可能下的位置——展示了 AI 可以产生超越人类直觉的策略。

2022 年——ChatGPT 发布:ChatGPT 在两个月内达到 1 亿用户——历史上最快的用户增长。它让 AI 从学术界的小众话题变成了每个人都关心的日常话题。

每两个里程碑之间的间隔在缩短——从 14 年到 5 年再到 4 年再到 6 年。AI 的发展在加速,而我们所处的时代,正处在这场变革的中心。

十一、AI 技术栈全景图

现代的 AI 应用通常构建在多层的技术栈上:

基础设施层:GPU/TPU 硬件、云服务(AWS SageMaker、GCP Vertex AI)、ML 平台(MLflow、Kubeflow)。这一层提供算力和 ML 工程的基础设施。

框架层:PyTorch(研究首选)、TensorFlow(工业部署)、JAX(高性能计算)。这些框架提供了构建和训练模型的工具。

模型层:基础模型——通过大规模预训练获得通用能力,然后在特定任务上微调。目前最主流的模型包括 GPT-4/Claude/Gemini(闭源)和 Llama/Mistral/Qwen(开源)。

应用层:提示工程工具(LangChain)、向量数据库(Pinecone/Weaviate)、Agent 框架(AutoGPT/LangGraph)。这一层帮助开发者快速构建 AI 应用。

用户体验层:聊天界面、API 接口、嵌入式 AI 功能。无论底层技术多复杂,用户体验层决定了用户感受到的 AI 能力。

每一层都在快速发展——基础设施层出现了专门为 AI 设计的芯片(TPU、Groq),框架层不断优化训练和推理效率,模型层的能力以月为单位在提升。理解这个技术栈有助于你在构建 AI 应用时做出正确的技术选型。

了解 AI 的技术栈全景非常重要——它帮你理解自己在整个 AI 生态系统中处于什么位置。无论你是应用开发者(在应用层工作)、模型开发者(在模型层工作)还是基础设施工程师(在基础设施层工作)——理解上下游的依赖关系和能力边界都能让你更有效地协作和决策。AI 技术的快速变化要求我们保持持续学习的习惯——今天最先进的模型半年后可能已被超越,但底层原理和架构思维的价值是持久的。

延伸阅读