Xue Hai Wu Ya · 学 · 海 · 无 · 涯

学 海 无 涯

一份属于自己的知识合集,随时可读、随处可读
2026·持续增补·xuehai-wuya.pages.dev
Volume · 01

网 络 篇

从零开始,一览网络世界的骨骼与经络
CH · 01

序章 · 网络是什么

What is a Network

网络(Network),本质上不过是"让两台机器能说上话"的一整套约定与设施。你手中的手机、桌上的电脑、远在天边的服务器——只要它们之间能传递信息,就构成了网络。

先看你现在正在发生的事

此刻你正在浏览 xuehai-wuya.pages.dev 这个页面。你有没有想过,这背后其实发生了这些事?

你的手机 / 电脑

发出一个"我想看这个网站"的请求。

路由器 / 运营商

把请求转出去,穿越好几台"中转站"(路由器)。

DNS 翻译

xuehai-wuya.pages.dev 这个名字翻译成一串数字(IP),机器只认数字。

Cloudflare 服务器

某台在离你最近城市的机房里的服务器,收到你的请求。

返回网页

服务器把 HTML 顺着原路送回,你的浏览器把它渲染成你看到的样子。

短短几百毫秒之内,全球可能穿越了几十台设备。本篇要做的,就是让你逐步看懂这一切。

一句话理解

把网络想象成一条条看不见的公路:路面(物理线路)、交通规则(协议)、门牌号(IP 地址)、目的地房间号(端口)、快递员(路由器)——所有这些加在一起,才让"你发一条消息,对方能收到"这件事成立。

Analogy · 譬喻

寄一封信:你在信封上写下"某市某街某号(IP)张三收(端口)",投进邮筒(发送);邮局按流程分拣、转运(路由);最终送到收信人手上(接收)。网络传输,几乎就是这整个过程的电子版。

为什么要学网络

01

看懂"日常"

WiFi 为何断线、网页为何打不开、扫码为何转圈——理解原理便不再玄学。

02

解决问题

路由器该如何配置、DNS 为什么要换、VPN 究竟是什么——都能自己判断。

03

拓展视野

从聊天软件到 AI 大模型,几乎所有互联网产品的底层都躺着这套逻辑。

CH · 02

基础概念 · 主机、协议与地址

Hosts, Protocols & Addresses
生活场景
🍜 你在美团上点了一份外卖

此刻你在餐桌前,手机是点单方;美团的机房里有一台机器负责接单,是接单方;订单能顺利到达,是因为你们双方遵守同一份"下单规则"——什么时候写地址、什么时候填联系方式、错误怎么处理,规则清清楚楚。

网络里也一样,需要三样东西:参与者规则身份标识

入门先要认识三个最常听到的词:主机协议地址。它们像"参与者、规则、身份证",缺一不可。

三个最基础的概念

术语英文通俗理解举例
主机Host联网的任何一台设备手机、电脑、服务器、智能音箱
协议Protocol双方约定好的说话规则HTTPTCPDNS
地址Address一台设备的身份编号192.168.1.1(IP)、a4:5e:...(MAC)
客户端Client发起请求的那一方你的浏览器
服务器Server提供服务、响应请求的那一方百度的机房
数据包Packet被拆成小块的信息一张图片可能被拆成上千个包
Note · 提示

"协议"是网络学习中最重要的一个词。凡是双方需要交换信息,就必然存在某种协议。只要理解了"协议是一份约定书",后面所有 HTTP、TCP、IP 都不难理解。

CH · 03

分层模型 · OSI 与 TCP/IP

Layered Models
生活场景
📦 一个跨国包裹的旅行

你在网上买了个东西,从美国仓库寄到你家。这个包裹的旅行是分层的:

只在乎"东西好不好用";
商家负责打包、贴单;
物流公司负责选路线、转运;
飞机 / 卡车 / 快递员负责真的把箱子搬过来。

每一层只操心自己的事——你不用知道飞机什么型号,快递员也不需要知道你买了什么。这就是"分层"的智慧。

网络之所以能运作,是因为把一件"从一台机器传数据到另一台机器"的复杂事,切成一层一层的小事,每一层只操心自己那一块。上层不必知道下层怎么做,下层也不必理会上层内容是什么。

OSI 七层模型(学院派参考)

1984 年国际标准化组织提出的经典模型,把网络分成七层。虽然实际很少完全按七层实现,但它是理解网络的最佳教学地图

L7
应用层Application
用户看到的东西:网页、邮件、聊天
L6
表示层Presentation
数据格式、加密、压缩
L5
会话层Session
建立/维持/结束一次会话
L4
传输层Transport
保证数据从进程到进程可靠到达(TCP/UDP)
L3
网络层Network
寻址与路由,让数据穿越千山万水(IP)
L2
数据链路层Data Link
相邻两台设备之间的可靠传输(MAC / 以太网)
L1
物理层Physical
电信号、光信号、电磁波——真实的比特

TCP/IP 四层模型(工程实用版)

互联网工程中实际使用的模型更精简:应用层 → 传输层 → 网络层 → 网络接口层。它是 OSI 七层的"合并简化版",也是你以后遇到最多的说法。

OSI 七层 与 TCP/IP 四层 的对应关系 横向对比,粗看即懂
CH · 04

常见协议 · 一览通用语言

Common Protocols
生活场景
🗣️ 你和外国人说话,得先约好用哪种语言

你会中文,对方会英文。要交流,就得约定一种共同语言——是英文?是普通话?是手语?这叫"协议"。

网络里的"协议"就是这个意思——两台机器约定用什么方式说话。看网页用一种方式(HTTP),发邮件用另一种(SMTP),视频通话又不一样(RTP/UDP)。

协议是"网络的语言"。日常你会反复看到这些缩写,先建立最粗略的印象即可:

协议层级作用你可能见过它
HTTP / HTTPS应用层网页内容传输浏览器地址栏 https://
DNS应用层把域名翻译成 IPbaidu.com 变成 110.242.68.66
SMTP / IMAP应用层收发邮件邮件客户端配置
SSH应用层安全远程登录程序员登录服务器
TCP传输层可靠、有序、按字节流传输网页、聊天、文件下载
UDP传输层快速、不保证到达视频通话、游戏、直播
IP网络层寻址与路由你的公网 IP
ARP链路层由 IP 找到 MAC 地址局域网内互相识别
Analogy · 譬喻

TCP vs UDP:TCP 像挂号信,逐件签收、丢了会补寄;UDP 像广播喇叭,说一次就过去,丢了就丢了。视频聊天宁可掉几帧也不能卡顿,所以偏爱 UDP;网页则要求内容完整,所以用 TCP。

日常上网中,各类协议大致的流量占比 示意数据,用于建立直观印象
CH · 05

IP 与端口 · 门牌与房间

IP & Port
生活场景
🏢 给一栋写字楼里的同事寄快递

你要寄东西给一位朋友,光写"北京市朝阳区某某大厦"够吗?不够——大厦里有上千人,快递员不知道送给谁。

你还得写"1503 室 张三",快递才能真正送到人手上。

把这套逻辑搬到网络里:
· IP 地址 = 那栋"大厦的地址",用来找到哪台机器
· 端口 = 大厦里的"房间号",用来找到那台机器上的哪个程序

如果说 IP 地址是一栋楼的门牌号,那 端口就是这栋楼里的具体房间号。数据要送达,必须知道"送到哪栋楼的哪个房间"。

IP 地址

IPv4

四段数字

192.168.1.1,共约 43 亿个地址,早已不够用。

IPv6

八段十六进制

2001:db8::1,地址空间几乎无限,正在逐步普及。

私网 IP

局域网内使用

家里的 192.168.x.x10.x.x.x——只在本地有效。

公网 IP

互联网上唯一

由运营商分配,能被外网访问到。

端口

端口是 0 – 65535 的一个数字,用来区分"同一台机器上运行的不同程序"。几个你必须眼熟的默认端口:

端口协议用途
80HTTP普通网页
443HTTPS加密网页
22SSH远程登录
53DNS域名解析
3306MySQL 数据库默认端口
CH · 06

一次访问的旅程 · 从输入网址到看到网页

The Journey of a Request
生活场景
🚕 打车去朋友家的全过程

你要去一位朋友家,只知道名字不知道详细地址。你会怎么做?

① 打电话问朋友要地址(把名字变成地址);
② 打开滴滴,输入地址、叫车(建立联系);
③ 上车、跟司机说"走吧"(发出请求);
④ 司机开过去,把你送到(响应到达);
⑤ 到了门口,敲门进去看到朋友(把内容呈现出来)。

你在浏览器输入 www.baidu.com 到看到百度首页——背后发生的事,几乎是这五步的电子版。

以你在浏览器输入 www.baidu.com 为例,短短几百毫秒之内,其实发生了六个关键动作。看懂这一段,等于把前面所有概念串成一条线。

域名解析(DNS)

浏览器把 www.baidu.com 交给 DNS,问:"这个名字对应哪个 IP?"很快收到答案,比如 110.242.68.66

建立 TCP 连接(三次握手)

浏览器与服务器互相确认:"我要说话(SYN)— 我收到,我也要说(SYN+ACK)— 好,我们说吧(ACK)"。此时通道建成。

TLS 加密握手(若是 HTTPS)

双方协商加密算法、交换密钥,让后续内容不被中间人偷看。

发送 HTTP 请求

浏览器发出:GET / HTTP/1.1,告诉服务器"给我首页"。

服务器响应

服务器返回 HTML、CSS、JS、图片等资源,携带状态码(200 OK 表示成功)。

浏览器渲染

浏览器把收到的代码解析、绘制成你看到的网页,完成整个旅程。

一次典型 HTTPS 请求的各阶段耗时(示意) 让你对"快慢"有直观感觉
CH · 07

网络设备 · 数据的驿站

Network Devices
生活场景
🛣️ 一次快递从北京到深圳,中间经过多少地方?

你在北京寄一个包裹去深圳,快递不会直接飞过去。它会经过:

· 小区门口的丰巢柜(临时收件点)
· 市内分拣中心(按目的地分堆)
· 机场 / 高铁站(干线运输)
· 深圳的分拣中心(再分堆)
· 快递员的电动车(最后一公里)

网络数据的旅程一模一样,只不过"驿站"变成了各种设备:路由器、交换机、防火墙、网关——每个都有自己的分工。

数据从你到远方,中间要经过若干"驿站"。它们各自分工:

Hub

集线器

最原始,只会广播——早已被淘汰,了解即可。

Switch

交换机

工作在链路层,按 MAC 地址在局域网内精准转发。

Router

路由器

工作在网络层,按 IP 地址跨网络转发——家里那台"猫盒子"就是它。

Firewall

防火墙

按规则允许/拦截数据包,是网络的守门人。

Gateway

网关

连接两个不同网络的"桥",家用路由器同时充当网关。

AP

无线接入点

把有线信号转成 WiFi 信号,让手机、笔记本无线上网。

小结 · Recap

到此,你已完成一次从概念 → 模型 → 协议 → 地址 → 旅程 → 设备的完整巡礼。剩下的深入话题——安全、无线、云——会作为独立章节陆续加入。

CH · 08

HTTP 深读 · 请求、方法与状态码

HTTP In Depth
生活场景
☕ 在咖啡馆点单

你走进星巴克,跟店员的对话是这样的:

你:"请给我一杯拿铁,热的,中杯。"(请求
店员:"好的,等一下。"(确认收到
…片刻后…
店员:"您的拿铁好了,请拿走。"(响应

浏览器向服务器要网页,就是这套"点单 → 上菜"的循环。这个循环用的"点单话术"就叫 HTTP。

HTTP(HyperText Transfer Protocol,超文本传输协议)是你每天点开一个网页时,浏览器与服务器之间讲的那门语言。它简单、直白、几乎无处不在。

一次 HTTP 对话长什么样

本质上就是"客户端问 → 服务器答",两段纯文本:

# 客户端发出的请求(Request) GET /index.html HTTP/1.1 Host: www.example.com User-Agent: Chrome/120 Accept: text/html # 空一行表示头结束 # 服务器返回的响应(Response) HTTP/1.1 200 OK Content-Type: text/html; charset=utf-8 Content-Length: 1024 <!doctype html><html>...</html>

请求由 起始行 + 头部字段 + 空行 + 可选正文 组成;响应同样如此。看似简陋,却是撑起整个 Web 的骨架。

常用 HTTP 方法

GET POST PUT PATCH DELETE HEAD OPTIONS
方法语义典型场景是否幂等
GET读取资源打开网页、查询数据
POST提交新数据登录、发帖、上传
PUT整体替换资源更新用户资料
PATCH局部修改只改一个字段
DELETE删除资源删帖、注销
HEAD只取响应头,不要正文探测资源是否存在
OPTIONS询问服务器支持什么跨域预检
Note · 幂等

"幂等"意思是:同一个请求,做一次和做一百次结果一样GET 只是读、不会变;DELETE 删过就是删过,再删也是"没有"。而 POST 每一次都会新增一条数据,所以不幂等。

状态码 · 五个家族

响应的第一行有一个三位数字,用百位划分家族,看百位就能猜出七八分:

1xx
Informational · 情报
"我收到了,你继续"。日常几乎见不到。
2xx
Success · 成功
200 OK、201 Created、204 No Content。是最想看到的家族。
3xx
Redirect · 重定向
"资源搬家了,去新地址找"。301 永久、302 临时、304 缓存未变。
4xx
Client Error · 客户端错
400 请求写错了、401 没登录、403 没权限、404 找不到、429 请求太多。
5xx
Server Error · 服务器错
500 内部错误、502 网关错、503 暂不可用、504 上游超时。锅在服务器。

常见头部字段

  • Host目标网站的域名,一台服务器可挂多个网站
  • User-Agent浏览器/客户端身份标识
  • Content-Type正文数据类型,如 application/json
  • Cookie客户端存的小凭证,登录状态就靠它
  • Authorization带 Token 的身份认证
  • Cache-Control缓存策略,控制多久重新拉取

HTTP 版本演进

HTTP 协议的三代演进 · 核心指标对比 数字为示意,代表每一代性能量级变化
CH · 09

DNS 深读 · 名字如何变成地址

DNS Resolution
生活场景
📞 打114查号台

你要联系"北京大学招生办",但只记得名字,不记得电话号码。怎么办?

拨 114 查号台,告诉他名字,他一层层帮你查——先查是哪所学校,再查招生办的号码,最后把电话回给你。

你记得住 baidu.comweibo.com 这些名字,但机器只认数字(比如 110.242.68.66)。DNS 就是互联网上的 114 查号台,把"名字"翻译成"数字"。

DNS(Domain Name System,域名系统)是互联网的"电话簿"——你只记得住 baidu.com 这样的名字,机器却只认 110.242.68.66 这样的数字,DNS 负责在二者之间来回翻译。

为什么要有 DNS

人类的记忆是"语义型"的:容易记住 zhihu.com,很难记住 103.41.167.234。而且,同一个网站背后可能有几十上百台服务器 IP,还会变来变去;DNS 让你只关心名字,把 IP 交给系统。

域名的层级结构

域名从右向左,是"越大越靠右"的树形结构:

www . baidu . com . ↑ ↑ ↑ ↑ 主机名 二级域名 顶级域名 根(通常省略)
  • 根 (Root)整棵树的起点,全球共 13 组根服务器
  • 顶级域 TLD.com / .cn / .org / .io
  • 二级域你注册来用的名字,如 baidu
  • 子域名你可以自定义的前缀,如 wwwmail

一次解析 · 递归+迭代

浏览器先查缓存

浏览器 → 操作系统 → hosts 文件;若命中就直接用。

问本地 DNS(递归解析器)

通常是运营商或公共 DNS(如 8.8.8.8223.5.5.5)。

本地 DNS 逐级问询

问根 → 问 .com → 问 baidu.com 的权威 DNS。

拿到 IP 返回给你

本地 DNS 记住结果(缓存 TTL 秒),下次直接答。

常见 DNS 记录类型

记录含义示例
A域名 → IPv4baidu.com → 110.242.68.66
AAAA域名 → IPv6google.com → 2404:6800::200e
CNAME域名 → 另一个域名(别名)www.a.com → a.com
MX邮件服务器地址企业邮箱配置
TXT任意文本,用于校验、SPF、DKIM域名归属证明
NS该域由哪些 DNS 服务器管辖切换 DNS 服务商
Analogy · 譬喻

DNS 就像"114 电话查号台":你只说"我要找北京大学",查号台一层一层帮你查到具体号码——只不过这一切在 20 毫秒内完成,且每天在全球发生数万亿次。

CH · 10

TCP 三次握手与四次挥手

TCP Handshake
生活场景
📱 打电话之前,你俩要先确认能听到

你打电话给朋友,接通后的对话是不是这样:

你:"喂?能听到吗?"(我发送 OK 吗?
朋友:"能听到,我说话你也能听到吗?"(你发送 OK,我也发送试试
你:"能。"(你也发送 OK,可以正式聊了

——这就是"三次握手"。你会发现少一次都不行:如果朋友没说第二句,你不知道他能不能听到你;如果你没说第三句,朋友也不确定他讲的话你能不能听到。

TCP 建立一次连接,需要三个来回;关闭连接,需要四个。这是网络课程最经典的"必背题",理解它能一举打通传输层。

三次握手 · 建立连接

Client · 客户端Server · 服务器
① SYN, seq=x
我想和你建连接,我的初始序号是 x
② SYN + ACK, seq=y, ack=x+1
我同意,我的初始序号是 y,也确认收到你的 x
③ ACK, ack=y+1
确认收到你的 y,连接建立完成

为什么是 三次而不是两次?因为要让双方都确认对方能收、能发。少一次,服务器就无法确认自己发的包客户端能收到。

四次挥手 · 断开连接

Client · 客户端Server · 服务器
① FIN, seq=u
我说完了,想关
② ACK, ack=u+1
收到,但我可能还有话没说完
③ FIN, seq=v
我也说完了,可以关
④ ACK, ack=v+1
收到,正式关闭

之所以要四次,是因为 TCP 是全双工——每一方"我说完了"要单独确认。中间那"两次"看似分开,其实是服务器"我收到你要关"与"我这边也关了"两条独立信号。

TIME_WAIT

主动关闭方在 ④ 之后会进入 TIME_WAIT 状态等待 2×MSL(大约 60 秒),确保最后那个 ACK 真的送达。你如果做服务端开发遇到"端口占用"报错,多半就是它。

CH · 11

子网与 CIDR · 把 IP 划成小院子

Subnetting & CIDR
生活场景
🏘️ 一个小区的门牌怎么设计

假设有个新小区叫"阳光家园",里面有 1000 户人家。你会怎么编号?

· 简单粗暴每户一个从 1 到 1000 的编号,找起来累死;
· 更聪明的做法:先分"1 号楼、2 号楼……",每栋楼再分"101、102、201……"。

这样地址就有层级了。找 "3 号楼 502 室" 就非常快。

IP 地址世界里也是这么划分的:把庞大的 IP 空间切成一个个"子网"(一栋楼),每个子网里有若干"主机号"(房间号)。/24/16 这些数字,就是告诉你"这一片是一栋多大的楼"。

一个 IP 地址实际上分成两半:网络号(哪个院子)+ 主机号(院子里的第几户)。子网掩码(Subnet Mask)就是那条"分割线"。

CIDR 记法

今天最常用的是 CIDR(Classless Inter-Domain Routing)写法,把掩码写成斜杠加数字:

  • 192.168.1.0/24前 24 位是网络号,后 8 位是主机号 → 254 台可用主机
  • 10.0.0.0/16前 16 位是网络号 → 65,534 台可用主机(大型公司内网)
  • 172.16.0.0/12前 12 位固定 → 约 100 万台可用主机
  • /32只有一台主机(常用于路由规则)

三段私有 IP 段(家用/公司内网专用)

网段范围典型用途
10.0.0.0/810.0.0.0 – 10.255.255.255大型企业内网
172.16.0.0/12172.16.0.0 – 172.31.255.255中型企业内网、Docker 默认
192.168.0.0/16192.168.0.0 – 192.168.255.255家用路由器、小型办公
Analogy · 譬喻

把 IP 想象成"小区门牌号":192.168.1.0/24 是"1 号院共 254 户";/16 就是把小区扩到 6 万多户。子网掩码就是那道"哪几位算院子、哪几位算门牌"的隔离墙。

CH · 12

NAT 与端口转发 · 一屋多户如何上网

NAT & Port Forwarding
生活场景
🏨 酒店总机替房客转接电话

一家酒店有 200 间房,但对外只公布一个总机号 010-12345678

你在酒店 1503 房间想打电话给朋友——朋友回电时怎么找到你?答:酒店前台记住了"这个外线来电对应 1503 房",帮你转接。

家里的路由器就是这个"酒店前台":你家里有几十个设备(手机、电脑、电视、扫地机器人……),但对外只有一个公网 IP。路由器帮你在内部和外部之间"转接"。

你家里明明有十几个设备联网,运营商却只分给你一个公网 IP——它们是怎么共用的?答案是 NAT(Network Address Translation,网络地址转换)

NAT 做了什么

你发出请求

手机 192.168.1.10:53211 → 想访问 baidu.com:443

路由器改写"发件人"

把源地址改成路由器的公网 IP 1.2.3.4:60001,并在自己的映射表里记住"这条 60001 对应内网 192.168.1.10:53211"。

百度回复

回复送到 1.2.3.4:60001。路由器查表 → 发回给内网原来那台设备。

端口转发 · 让外网访问家里的机器

反向操作:你有一台家庭服务器想让外部访问?在路由器上做端口映射

# 例:把外网 8080 转到内网 NAS 的 80 端口 Public 1.2.3.4:8080 → Private 192.168.1.100:80
Note · 后果

NAT 是 IPv4 地址不够用的"缓兵之计":它拯救了整个互联网,也破坏了原本"每台设备可直连"的对等网络。这也是 IPv6 想彻底解决的问题。

CH · 13

网络安全 · 加密、认证与常见威胁

Networking Security
生活场景
✉️ 你要给朋友寄一封信

你要给朋友寄一封信,谈的是私密的事。你担心三件事:

路上有没有人偷偷拆开看?(机密性)
信到手了,会不会被人偷偷改过内容?(完整性)
邮筒会不会突然罢工,信永远寄不到?(可用性)

网络安全操心的就是这三件事——业内简称 CIA。加密、签名、防火墙……都是围绕这三个目标展开。

网络安全的三大目标可以浓缩成 CIA——机密性(Confidentiality)、完整性(Integrity)、可用性(Availability)。不能被偷看、不能被篡改、随时可访问。

加密的两种基本套路

对称加密

Symmetric

加密解密用同一把钥匙。快,但麻烦在于"钥匙怎么安全地交给对方"。代表:AES。

非对称加密

Asymmetric

一把公钥公开、一把私钥保密。公钥加密的东西只有私钥能解。代表:RSA、ECC。

哈希

Hash

把任意数据变成固定长度指纹(不可逆)。用于校验完整性、存密码。代表:SHA-256。

数字签名

Signature

用私钥对数据摘要签名,对方用公钥验证——证明"这确实是我发的且没被改"。

HTTPS = HTTP + TLS

你在地址栏看到的小锁,背后是 TLS(Transport Layer Security):客户端和服务器先用非对称加密协商出一把临时对称密钥,之后所有内容都用对称密钥加密传输——既安全又快

常见威胁一览

攻击手法典型防御
中间人 (MITM)在你和服务器之间偷偷插一脚HTTPS + 证书验证
钓鱼 (Phishing)伪装成正规网站骗你输密码看清域名、启用 MFA
DDoS海量流量把服务器打瘫CDN、WAF、流量清洗
SQL 注入在输入框里塞恶意 SQL参数化查询、ORM
XSS在网页里注入恶意脚本输入转义、CSP
暴力破解穷举密码强密码、频次限制、锁定
日常习惯 · 三条

1. 密码不复用,用密码管理器。
2. 尽量开启二步验证(MFA)。
3. 公共 WiFi 上做敏感操作前,先确认是 HTTPS。

CH · 14

无线与移动网络 · WiFi、蓝牙与 5G

Wireless & Mobile
生活场景
📻 你家里同时有多个"广播"

想象你家里同时开着:一台收音机(长距、慢),一台无绳电话(中距),一副耳机(短距)——它们都是"无线",但用了不同的频段、不同的规矩,互不打扰。

网络世界也是这样:
· WiFi:家里几十米范围,速度快;
· 蓝牙:几米,专门给耳机、鼠标;
· 4G / 5G:几公里,靠基站;
· NFC:几厘米,用于刷公交、支付。

它们都是"无线",但分工不同、用途不同。

把线拔掉、让数据通过电磁波传输,就是无线网络。它们靠频段信道协议三件事区分。

WiFi 各代速览

标准俗名频段理论速率
802.11nWiFi 42.4 / 5 GHz600 Mbps
802.11acWiFi 55 GHz3.5 Gbps
802.11axWiFi 6 / 6E2.4 / 5 / 6 GHz9.6 Gbps
802.11beWiFi 72.4 / 5 / 6 GHz46 Gbps
2.4G vs 5G WiFi

2.4GHz 像低频广播——传得远、穿墙好,但速度慢、干扰多;
5GHz 像高频广播——速度快、干扰少,但传不远、穿墙差。所以现代路由器"双频合一",让手机自动选。

蓝牙、NFC、Zigbee

  • 蓝牙 (BT)短距、点对点,用于耳机、鼠标、传文件
  • BLE蓝牙低功耗,用于手环、门锁、iBeacon
  • NFC数厘米,用于支付、门禁、公交卡
  • Zigbee低功耗自组网,智能家居设备常用

蜂窝网络 2G → 5G

蜂窝网络代际演进 · 峰值下行速率 数值为常见理论峰值,实际体感取决于基站与频段

5G 的意义不只是"更快",还有 低时延(1ms 级)海量连接(每平方公里 100 万设备)——这是自动驾驶、工业互联网、AR/VR 的地基。

CH · 15

云与边缘 · CDN、云网络与容器

Cloud & Edge
生活场景
☕ 星巴克为什么开满全城?

星巴克咖啡豆的原产地在南美。如果全国人喝一杯咖啡,都要去南美的仓库取豆,肯定慢死。

所以星巴克在每个城市开分店,甚至每条街都开一家——豆子提前运到分店,你要喝就近取。这是"离用户近"。

网络里也有类似的东西:CDN(内容分发网络)。腾讯视频、B 站的内容不会每次都从深圳源头服务器拉,而是提前放在离你最近的城市机房里,你打开就几乎瞬间加载。

你今天访问的 xuehai-wuya.pages.dev 也是——Cloudflare 在全球有 300+ 个"分店",你打开的是离你最近那一家。

过去的网络世界是"我搭机房、我买带宽、我配路由器";今天大部分服务都跑在上,用户和服务之间还夹着边缘节点

CDN · 内容分发网络

CDN 是"把内容提前搬到离你最近的机房"的技术。你在深圳打开某网站,其实是访问了深圳的缓存节点,而不是远在美国的源站。

请求先命中 CDN 边缘节点

DNS 会根据你的位置返回最近节点的 IP。

节点若有缓存 → 直接返回

毫秒级响应,源站毫无负担。

没有缓存 → 回源

从源站拉一次,缓存下来,之后同一区域的人都受益。

云网络三件套

VPC

虚拟私有云

你在云上"圈出的一块独立网络",就像自己的机房。

SLB

负载均衡

一个公网 IP 分发到多台后端服务器,避免单点。

SG

安全组

云上的防火墙规则,决定谁能连你的机器。

容器网络

Docker、Kubernetes 让每个应用装进一个"集装箱",容器之间通过虚拟网络互通。ServiceIngressPod IP 是你以后会反复看到的词——但本质仍是本文前面讲过的 IP、端口、DNS。

思路 · Recap

无论多么复杂的云原生架构,拆开都是 IP + 端口 + 协议 + 路由 + DNS。只是数量更多、层级更深,运行在别人的机房里而已。

CH · 16

排错工具箱 · 五个救急命令

Troubleshooting Toolkit
生活场景
🔧 水管漏水了,你怎么找原因?

家里水管漏水,你不会直接砸墙——会先一段段排查

① 总闸阀有水吗? → 没水是自来水公司的事;
② 家里主管道通吗? → 不通是入户线的事;
③ 具体哪个水龙头出问题? → 找到罪魁祸首。

网络出问题——"网页打不开"——也是这么一层一层排查的。本章给你五个"网络水管工工具":pingtraceroutenslookupcurlnetstat

当"上不了网"时,怎样一步步定位?以下五个命令是终端里的"急救包",Windows 和 macOS/Linux 略有差异,写法我一并给你:

① ping · 测通不通

发送 ICMP 包,看对方能不能回。是最基础的"我能到吗?"

$ ping baidu.com # 若一直丢包 → 对方或链路有问题

② traceroute · 走了哪条路

逐跳追踪数据包路径,看在哪一站出问题。

Linux/mac $ traceroute baidu.com Windows > tracert baidu.com

③ nslookup / dig · 域名解析

怀疑域名解析出错时用它。

$ nslookup baidu.com $ dig +short baidu.com # 更漂亮的输出

④ curl · 手动发一次 HTTP 请求

不打开浏览器就能看服务器返回。

$ curl -I https://baidu.com # 只看响应头 $ curl -v https://baidu.com # 显示握手细节

⑤ netstat / ss · 谁占了端口

本机端口被谁占用、有哪些连接开着。

Linux $ ss -tunlp macOS $ lsof -i -P -n | grep LISTEN Windows > netstat -ano | findstr :443
排错三步法

ping 网关能通吗?→ 不能就是本地网络问题。
ping 8.8.8.8 能通吗?→ 不能就是运营商问题。
ping baidu.com 能通吗?→ 不能但 ② 通,就是 DNS 问题。

CH · ??

未完待续 · 更多板块

Coming Chapters

下方为预留占位,后续章节将按同样的排版规则加入。

◇ ◇ ◇

IPv6 与下一代互联网

为何 IPv4 不够用、IPv6 长什么样、如何过渡。

◇ ◇ ◇

网络性能优化

为什么慢?TTFB、RTT、丢包与拥塞控制。

◇ ◇ ◇

网络编程入门

Socket、Web 请求、简单服务器代码实战。

Volume · 02

Git 篇

用一部时间机器,管理你所有的代码与文字
CH · 00

迎宾章 · 从你今天做的事说起

A Warm Welcome

在讲抽象概念之前,我先用你今天亲手做的那件事——把"学海无涯"网站放到互联网上——一步步告诉你:Git 是什么、GitHub 是什么、它们到底做了什么。

你今天到底做了什么

今天下午,你完成了这样一套流程:

你的电脑上写好了一份网页

它就是那个 xuehai-wuya 文件夹,里面有 index.html、字体、图片脚本等。此时它只在你的硬盘上,别人看不到。

你安装了 Git,并用它"记录"了整个文件夹

Git 是一个装在你电脑上的工具。它给你的文件夹打了一个"档案编号",把整个文件夹的内容拍了一张"完整快照"存起来。这一步叫 提交(commit)

你在 GitHub 上开了一个"仓库"账户

GitHub 是互联网上的一个网站,任何人可以在上面免费开一个"文件夹储物柜",叫做仓库(Repository)。你开的那个柜子叫 WANG-star-alt/xuehai-wuya

你把本地的档案推(push)到了 GitHub

Git 就像一个快递员,把你电脑上的这个文件夹的"完整快照"以及所有历史记录,一次性搬上互联网 GitHub 的那个储物柜。

Cloudflare 从 GitHub 那把柜子里"取件",摆到网上

Cloudflare Pages 是另一个网站,它盯着你在 GitHub 的那个仓库。你一 push,它立刻把新内容拿出来,架设成一个真正能访问的网址:xuehai-wuya.pages.dev

Analogy · 一个譬喻串起来

把你的电脑文件夹想象成你家书房里的一本手稿
· Git = 一个私人抄写员,替你把手稿的每一次改动都拍照存档;
· GitHub = 城市中央图书馆,愿意免费借你一个"专属书架"存这本书的所有版本;
· 你 push = 抄写员把最新的稿子送去图书馆书架;
· Cloudflare = 一个印刷厂,它看到图书馆有新稿子就自动开印,做成免费的报纸贴到互联网大街上。

三个名字,三种角色

Git

装在你电脑上的工具

它是一个软件,负责"记录、比较、回退"你的文件历史。离线也能用,跟互联网无关。

GitHub

互联网上的网站

它是一个"给 Git 用的云盘 + 社交平台",帮你把本地仓库放到网上,也让其他人能看到、协作。

Repository

仓库

就是"一个项目"。本地那份叫本地仓库,GitHub 上那份叫远程仓库。两者内容会通过 push / pull 保持同步。

常见的疑问,先在这里回答

  • Git 要联网吗?不用。本机做记录、看历史都不需要网。只有和 GitHub 传输时才要。
  • GitHub 一定要用吗?不是。Git 单独就能用;GitHub 只是最流行的"Git 云盘"。类似的还有 GitLab、Gitee。
  • 我上传的东西是啥?是你项目文件夹 + 每一次提交的完整历史。不是压缩包,是可查询的历史全集。
  • 为什么叫 push?因为是"推"——把本地的东西到远端。反过来把远端拉回本地叫 pull
  • 别人看得到吗?仓库是 Public 就任何人可看;Private 就只有你和你邀请的人可看。你的是 Public。
看完这章你应该能回答

1. Git 是软件还是网站?(软件)
2. GitHub 是软件还是网站?(网站)
3. 你今天的网页托管在哪台服务器上?(Cloudflare 的边缘节点,源码存在 GitHub)
4. 如果 GitHub 挂了,你本地代码会丢吗?(不会,本地那份完整独立)

CH · 01

序章 · Git 是什么

What is Git

Git 是一部时间机器,也是一份分身术——它记住你每一次修改,让你可以随时回到过去;也让你同时活在多条时间线里,做完实验再决定要不要保留。

一句话理解

Git 是一个分布式版本控制系统:它把你的整个项目历史存在一个 .git 文件夹里,让你可以查看、比较、回退任何一次改动。它由 Linux 之父 Linus Torvalds 于 2005 年为管理 Linux 内核而写。

Analogy · 譬喻

如果说"网盘"是保存最新一份文件,Git 就是保存所有版本的私人史官——从你项目诞生那一秒起的每一次改动都被记录,且可以用一条命令回到任意时刻。

为什么要学 Git

01

不再"final_v3_真的最终版"

每一次改动自动有版本号,随时可回退,不再靠文件名区分。

02

多设备无缝同步

推到 GitHub,家里公司随时接着写。

03

多人协作不打架

用分支把每个人的改动隔离,最后再合并。

04

时光机自救

"糟糕,代码删多了" —— 一条命令回到 30 分钟前。

Git 的三条"底层信条"

不是要背,是要理解——理解了这三条,很多命令就顺理成章:

  • ① 快照式Git 不是记"这次改了哪几行",而是每次都拍一张完整的文件夹快照。这样任何时刻都能立刻切到任何一版。
  • ② 分布式每台电脑上都有完整历史——GitHub 挂了、别人硬盘坏了,你这里都还在。没有"中央服务器"这个单点。
  • ③ 只增不减Git 几乎不会真删东西。删掉的东西通常还在硬盘里 30 天,用 git reflog 大概率能捞回。
CH · 01b

Git 与 GitHub · 二者到底什么关系

Git vs. GitHub

很多人第一次听到 Git 和 GitHub,会以为它们是同一样东西。其实完全不是。它们的关系类似"Word 之于 OneDrive"、"微信之于腾讯"——一个是工具,一个是承载工具产物的平台。

先看一张对照表

维度GitGitHub
是什么一个软件(命令行工具)一个网站(在线服务)
装在哪里你自己的电脑别人家的服务器(微软的机房)
需要联网吗不需要需要(是个网站嘛)
谁做的Linus Torvalds,2005 年三个美国人 2008 年创立,2018 年被微软收购
要不要钱免费开源基础版免费,企业版收费
能替换成什么Git 几乎没替代品可换 GitLab、Gitee、Bitbucket 等
做什么用记录、比较、回退文件版本把你的 Git 仓库放到网上、协作、展示
核心动词commit / branch / mergePull Request / Issue / Star

一句话说清关系

Analogy · 便捷记忆

Git 是"照相机",GitHub 是"网络相册"。
没有相册,你依然能拍照;但把照片放到相册里,别人才能看到、评论、点赞。
少了照相机,相册也无照可放。二者互相成就,但确实是两件事。

为什么大家都用 GitHub

01

免费的云备份

你本地硬盘坏了、电脑丢了,GitHub 上那份完整还在。

02

多设备同步

家里改一半、去公司 git pull 就能接着写。

03

开源社交

全球开发者的"聚集地",很多顶级项目都在这里协作。

04

免费部署

Cloudflare / Vercel / Netlify 都能直连 GitHub 自动部署——就像你今天做的一样。

三个容易搞混的名字

  • Git你电脑上的软件。你今天 winget install 装的就是它。
  • GitHub一个具体的网站:github.com。你今天注册的账号 WANG-star-alt 就在这。
  • Git 仓库 / GitHub 仓库同一个东西的两个位置——"本地仓库"在你电脑里、"远程仓库"在 GitHub 上。用 push/pull 同步。

你今天做的事,用这两个概念重述一次

# 第 1 步:本地——用 Git 建立仓库 PS> git init # Git 在你电脑上开档 PS> git add . # 把所有文件放进"待打包"清单 PS> git commit -m "..." # 打包成一次"完整快照" # 第 2 步:远程——把本地推到 GitHub PS> git remote add origin https://github.com/WANG-star-alt/xuehai-wuya.git PS> git push -u origin main # 把本地历史全部推到 GitHub # 第 3 步:Cloudflare(第三方,跟 Git/GitHub 无关) # 它自动监视你在 GitHub 的仓库,一有更新就重新部署
重要 · 认知

Git 和 GitHub 的关系类似"文件 → 网盘":Git 管的是版本,GitHub 管的是同步与共享。理解了这一点,剩下所有 Git 相关的概念都能对号入座。

CH · 02

概念地图 · 仓库、工作区、暂存区

Core Concepts

入门 Git 最重要的一步:建立"三个区"的心智模型。所有 Git 命令都是在这三个区之间搬运东西。

三个区 · The Three Trees

  • 工作区Working Directory —— 你当前看得见、能编辑的文件夹
  • 暂存区Staging Area / Index —— 一个"待打包"的清单,决定这次提交带走哪些改动
  • 仓库Repository —— .git 文件夹,保存所有历史版本
Analogy · 譬喻

寄快递:工作区是你桌面上散落的东西;暂存区是你挑好、放进纸箱的东西;仓库是快递公司的档案库,收下后就永久登记。
git add = 把东西放进纸箱;git commit = 封箱送走。

三条常用命令的定位

命令做什么影响哪个区
git add 文件把改动加入暂存区工作区 → 暂存区
git commit -m "说明"把暂存区打包为一次提交暂存区 → 仓库
git checkout 文件放弃工作区改动,回到上一版仓库 → 工作区
git reset 文件把改动从暂存区退回工作区暂存区 → 工作区
三个区之间的流动 · Git 命令的搬运方向 看懂这张图,Git 就入门一半
CH · 03

初次上手 · 从零建立一个仓库

First Repo

你已经用 Git 部署过 xuehai-wuya,我们复盘一下每一步的意义。

四步建立一个 Git 项目

初始化仓库

在项目文件夹里执行 git init——Git 会新建一个隐藏的 .git 目录,作为整个仓库的大脑。

配置身份

git config user.name "你的名字"git config user.email "你的邮箱"——决定这次提交的作者是谁。

加入所有文件

git add .——把当前目录里的所有变化放入暂存区。

提交

git commit -m "初次提交"——把暂存区打包成一次带说明的历史记录。

完整命令示例

PS> cd 'd:\我的项目' PS> git init PS> git config user.name "wang" PS> git config user.email "wang@example.com" PS> git add . PS> git commit -m "初次提交"
.gitignore

项目里总有一些"不想被跟踪"的文件(临时缓存、密码、大二进制)。在根目录建一个 .gitignore 文件,写上不想上传的内容,Git 就会自动忽略:

# .gitignore 示例 node_modules/ *.log .env .DS_Store *.zip
CH · 04

日常命令 · 十条最常用

Daily Commands

日常 95% 的 Git 使用,就是这十条命令的组合。背下它们,你就能自如工作。

命令作用使用频率
git status看当前哪些文件改动了、哪些进了暂存区★★★★★
git add .把所有改动加入暂存区★★★★★
git commit -m "说明"提交暂存区★★★★★
git push把提交推到远程(GitHub)★★★★★
git pull从远程拉取别人的更新★★★★☆
git log看历史记录★★★★☆
git diff看具体改动了什么★★★☆☆
git branch查看/新建分支★★★★☆
git checkout / switch切换分支★★★★☆
git merge合并另一条分支★★★☆☆

典型的一天

PS> git status # 看看有什么变化 PS> git add . # 全部纳入暂存 PS> git commit -m "新增登录页" # 提交 PS> git push # 推到远程
Note · Commit 说明的写法

一条好的提交信息应该一句话说清"这次改了什么、为什么"。业界流行的规范叫 Conventional Commits:feat: 新增登录功能fix: 修复分页错误docs: 更新 README

CH · 05

分支 · 平行世界的开关

Branching

分支(Branch)是 Git 最重要的特性:它让你可以在不影响主线的前提下尝试任何改动。做完满意就合并,不满意就抛弃。

分支是什么

分支不是"复制一份代码",而是一个指向某次提交的可移动指针。默认分支叫 main(旧版叫 master)。

分支常用命令

  • git branch列出所有本地分支,当前所在分支前面有 *
  • git branch feat-login新建一个叫 feat-login 的分支
  • git switch feat-login切换到该分支(新版命令)
  • git switch -c feat-login一步到位:新建 + 切换
  • git branch -d feat-login删除该分支(已合并的)
  • git branch -D feat-login强制删除(未合并也删)

分支的典型工作流

从 main 开一个新分支

git switch -c feat-search,开始搞"搜索功能"。

在分支上改代码、提交

正常 add / commit,改坏也不影响 main。

切回 main

git switch main,此时你看到的代码回到未加搜索功能的状态。

合并 or 抛弃

满意就 git merge feat-search;不满意就 git branch -D feat-search

Analogy · 譬喻

分支像写小说时的多个存档:主线剧情一直存着,你另开一个 slot 尝试"如果主角选另一条路会怎样"。写不下去就删掉存档,写好了就把它并回主线。

CH · 06

合并与冲突 · 两条河汇入一条

Merge & Conflicts

merge 与 rebase

merge

合并式

把两条分支的提交都保留下来,多一个"合并提交"节点。历史真实但可能显得杂乱。

rebase

变基式

把你的提交"复制粘贴"到目标分支尾部,历史看起来是一条直线。整洁但改写了历史。

建议

刚学 Git 时只用 merge 就够了,安全、直观。rebase 是熟练之后再学的进阶技巧。

冲突长什么样

当两条分支改了同一个文件的同一处,Git 无法自动判断该用谁的,就会产生冲突。文件里会出现这样的标记:

<<<<<<< HEAD 我这边的版本 ======= 另一分支的版本 >>>>>>> feat-search

三步解冲突

打开冲突文件

手动决定保留哪一边(或两边都要),删掉那些 <<</===/>>> 标记。

标记冲突已解决

git add 文件

完成合并

git commit(无需 -m,Git 会自动写一条合并说明)

CH · 07

远程 · 与 GitHub 对话

Remotes

本地仓库和远程仓库(GitHub 上那份)通过"远程地址"关联。默认远程别名叫 origin

常用远程命令

命令作用
git remote -v看已配置的远程地址
git remote add origin URL添加一个叫 origin 的远程
git remote remove origin移除远程
git push -u origin main首次推送并绑定跟踪关系(-u 只需要一次)
git push之后直接推
git pull拉取并合并远程更新
git fetch只拉取,不自动合并
git clone URL克隆一个远程仓库到本地

HTTPS vs SSH

  • HTTPS形如 https://github.com/xxx/yyy.git,每次推送要密码/Token
  • SSH形如 git@github.com:xxx/yyy.git,配好密钥后一劳永逸
Token 认证

从 2021 年起 GitHub 不再支持密码登录,必须用 Personal Access Token(PAT)。在 Settings → Developer settings → Personal access tokens 里生成,第一次 push 弹窗时把它当密码填即可。Windows 会用凭据管理器帮你记住。

CH · 08

时光机 · 回退、撤销与拯救

Undo & Recovery

Git 最迷人的地方,是几乎所有操作都可撤销。你以为删没了?只要提交过一次,就能捞回来。

不同场景对应不同"撤销"

情况命令
改错了,还没 add,想还原git checkout -- 文件git restore 文件
已经 add 了,想退回工作区git reset HEAD 文件git restore --staged 文件
已经 commit 了,想改上一条 commit 说明git commit --amend -m "新说明"
想撤销最近一次 commit(保留改动)git reset --soft HEAD~1
想彻底丢掉最近一次 commitgit reset --hard HEAD~1(危险)
想不改历史、追加一条"反悔"commitgit revert 提交号
终极救命 · reflog

如果你误 reset --hard 把提交搞没了 —— 别慌!git reflog 会列出你所有"HEAD 曾经指向过的位置",找到那个提交号,git reset --hard 提交号 就能救回。Git 通常要 30 天后才真正删除。

CH · 09

协作流 · PR、Fork 与团队工作流

Collaboration

Pull Request(PR)· 请求合并

在 GitHub 上,你不能直接把改动推到别人的仓库。标准动作是:

Fork

在别人的仓库右上角点 Fork,得到一个属于你自己的副本。

Clone 你的 Fork

git clone https://github.com/你/xxx.git,本地开始改。

开分支 + 改 + 提交 + 推

把改动推到你自己的 Fork。

发起 Pull Request

在原仓库页面点 "New pull request",说明你改了什么。等原作者审核合并。

三种主流团队工作流

01

Git Flow

有 master / develop / feature / release / hotfix 多种分支。经典但重。

02

GitHub Flow

只有 main + feature 分支。GitHub 官方推荐,轻量高效。

03

Trunk Based

大家都往 main 提交,短命分支即开即合。Google、Facebook 在用。

建议

小团队/个人项目 → GitHub Flow 就够了;大型持续发布产品 → Git Flow;追求速度的顶尖工程团队 → Trunk Based。

CH · 10

锦囊 · 高频问答与私藏技巧

Tips & Q&A

十个高频问答

  • Q · 忘了 -m 写说明?默认会弹出编辑器(vim/nano),按 i 编辑,写完 Esc:wq 保存退出
  • Q · 想少打 git status?配置别名:git config --global alias.s status,之后 git s 即可
  • Q · 提交历史像坨面条?git log --oneline --graph --all,一览无余
  • Q · 改动只想推一部分?git add -p 逐块选择要加什么
  • Q · 临时切走但不想 commit?git stash 暂存,回来后 git stash pop 还原
  • Q · 想看某文件的历史?git log -p 文件名
  • Q · 谁写的这一行代码?git blame 文件
  • Q · 想同步别人最新更新?git pull --rebase,比默认 pull 历史更整洁
  • Q · 上传了敏感信息怎么办?立即改密码 + 用 git filter-repo 清历史 + 强推。血泪教训是永远不要直接推 .env
  • Q · GUI 工具推荐?VS Code 自带 Source Control 面板;进阶用 GitKraken、SourceTree、Fork

三条私藏技巧

Tip · 1

写有意义的 commit 信息。一年后你翻历史,能不能一眼看懂当时改了什么,全看当时那句 -m。

Tip · 2

小步提交,频繁 push。一次改 1000 行难以复审也难以回退;一次改 100 行,回退极其精准。

Tip · 3

先建 .gitignore 再 git add .。否则一旦把 node_modules 之类的大目录传上去,之后想清很麻烦。

收束 · Recap

Git 的世界看似浩瀚,其实日常 90% 只用五个动作statusaddcommitpushpull。剩下的都是"救命"和"进阶",遇到时再查即可。

CH · ??

未完待续 · 更多板块

Coming Chapters
◇ ◇ ◇

Git 内部原理

对象、SHA-1、pack 文件、HEAD 指针背后的世界。

◇ ◇ ◇

GitHub Actions · CI/CD

推送时自动测试、自动部署,让代码自己会跑起来。

Volume · 03

AI 篇

一场关于"机器如何学会思考"的耐心讲述
CH · 00

迎宾章 · 从你每天用的那个"AI"说起

A Warm Welcome

孩子,坐下。你已经每天都在用 AI 了——只是没意识到。这一章我不讲公式,先带你看看 AI 已经悄悄住进了你生活的哪些角落,再一步步告诉你:这一切背后到底是怎么运转的。

生活场景
📱 你今天用手机的那两小时

早上闹钟响,你打开手机——从这一刻起,AI 就开始工作了:

相册自动把去年三亚的照片挑出来做成回忆视频;输入法还没等你打完就猜出下一个词;抖音第一条视频恰好是你想看的;美团推荐的午餐正是你上周想吃的;DeepSeek 或 ChatGPT 帮你写了一封邮件;高德告诉你绕开哪条路会少堵 8 分钟。

本篇要回答的十件事

  • Q1AI 到底是不是"活的"?它有意识吗?
  • Q2机器学习、深度学习、AI,是同一样东西吗?
  • Q3大模型(LLM)为什么这么厉害,它是怎么"想问题"的?
  • Q4Transformer 是什么?ChatGPT 里的 "T" 指的就是它吗?
  • Q5为什么 AI 会一本正经地胡说八道(幻觉)?
  • Q6怎么"问"AI,才能得到你想要的答案?
  • Q7AI Agent、RAG、微调、蒸馏……这些词到底啥意思?
  • Q8图片、视频、语音,AI 是怎么"生成"出来的?
  • Q9AI 会取代我的工作吗?我该怎么办?
  • Q10怎么判断哪些是 AI 的真本事,哪些是营销吹嘘?
Analogy · 一个譬喻

把 AI 想象成一个刚学会说话、但读过整座图书馆的孩子
· 它知道得非常多——因为读得多;
· 它说话很流畅——因为反复练过;
· 但它没有"经验"和"常识"——所以偶尔会一本正经地胡说;
· 它没有情感,只是在猜下一个最合适的词——这个"猜",就是本篇要拆给你看的核心秘密。

读完本篇你应该能

1. 用一句话向长辈解释什么是 AI;
2. 分清 AI、机器学习、深度学习、大模型;
3. 知道 ChatGPT / DeepSeek 每次回答背后发生了什么;
4. 会写"能得到好答案"的提示词;
5. 判断哪些 AI 说法是靠谱的、哪些是营销话术。

CH · 01

序章 · AI 到底是什么

What is AI

AI(Artificial Intelligence,人工智能)不是一个单一的东西,而是"让机器做那些原本需要人类智能才能做的事"的一整套技术与思路。它不神秘——本质上,它是一门"教机器识别规律"的学问。

一句话理解

如果一台机器能识别(认出这是猫)、能预测(明天大概率下雨)、能决策(这条路更快)、能生成(写一首诗、画一幅画)——它就在做 AI 的事。

Analogy · 譬喻

普通程序像菜谱——你写死每一步,它照做。
AI 像厨师学徒——你给它一千道菜的示范,它自己总结出"糖醋要先炒糖色"这样的规律,之后遇到新食材也能做出合理的菜。

AI 的四种典型能力

01

感知 · Perceive

把图像、声音、文字变成机器能懂的东西。
例:人脸解锁、语音转文字、扫码识别。

02

理解 · Understand

从内容里"读出意思"。
例:翻译、情感分析、搜索引擎判断你到底想找什么。

03

决策 · Decide

在多种选择里挑一个更好的。
例:推荐系统、自动驾驶、下棋 AI。

04

生成 · Generate

造出新的内容。
例:ChatGPT 写文章、Midjourney 画图、Sora 生成视频。

"弱 AI"与"强 AI"

你要分清两个层次,媒体经常混着讲:

类型英文能做的事今天到哪一步
弱 AI / 专用 AINarrow AI (ANI)只在某个特定领域超过人已经实现:下棋、写代码、看 CT 片
强 AI / 通用 AIGeneral AI (AGI)像人一样能干任何智力活尚未实现,但今天的大模型让它看起来近了很多
超级 AISuper AI (ASI)在所有领域全面超越人类仍是科幻,不是工程
Note · 提示

你今天用的 ChatGPT、DeepSeek、通义千问,虽然聊天很像人,但严格来说仍然是"弱 AI"——它们在"生成语言"这件事上极强,但没有身体、没有欲望、没有目标,也不"懂"自己在说什么。

AI 不会做的事(先记住这一点)

  • 没有意识它不"知道"自己是 AI,也不"想"任何事。
  • 没有真实理解它擅长模仿"像人的回答",但不像人那样体验世界。
  • 没有长时记忆你今天和它说的话,明天它默认不记得(除非产品给它加了记忆功能)。
  • 不会自我反思它可以"看起来在反思",那是训练数据里学到的反思腔调,不是真的在反思。
CH · 02

三个圈 · AI、机器学习、深度学习

AI vs ML vs DL
生活场景
🥘 教一个孩子做菜的三种方式

方式一(AI 的最早思路):你把菜谱一条条抄下来给他——"糖 5g,火开大 3 分钟"。他严格照做,能做出这一道,但换个食材就不会。

方式二(机器学习):你不给菜谱,只让他尝一千道菜,告诉他"这是酸的、这是咸的、这是好吃的"。他自己总结出规律,遇到新菜也能做出合理判断。

方式三(深度学习):还是让他尝,但这次他脑子里有一整套"味觉神经网络"——先感受咸淡、再判断浓淡、再感受层次,一层套一层。能力最强,但也需要更多的菜(数据)和更多的时间(算力)。

一句话理清三者关系

它们不是并列的三样东西,而是大圈套小圈深度学习 ⊂ 机器学习 ⊂ 人工智能

名字英文缩写它是什么典型例子
人工智能AI最大的圈。凡是"让机器有点智能"的都算,包括写死的规则专家系统、下棋程序、扫地机器人
机器学习MLAI 的一个流派:不写规则,让机器从数据里自己找规律垃圾邮件识别、房价预测、信用评分
深度学习DLML 的一个分支:用"深层神经网络"来学人脸识别、语音识别、大语言模型
生成式 AIGenAIDL 的一个方向:让 AI"造"新东西ChatGPT、Midjourney、Sora
大语言模型LLMGenAI 的当红品种:专门处理"语言"GPT-4、Claude、DeepSeek
Analogy · 一层套一层

AI 是"运动"这个大概念;ML 是"球类运动";DL 是"篮球";LLM 是"NBA 里的中锋"。
越往里越具体、能力越强,但也越挑食(要数据、要算力)。

为什么现在大家都在说"深度学习"

  • 数据够多了互联网 30 年积累了海量文字、图像、视频,训练素材空前充足。
  • 算力够便宜了GPU(显卡)让原本要几年才能训练完的模型,几周就能出结果。
  • 算法开了窍2017 年 Transformer 出现,让模型能真正"读长句子",是这一波革命的开端。
  • 效果一骑绝尘深度学习在图像、语言、语音上的表现,把传统方法远远甩开。
Recap · 收束

看到"AI",你要在心里默默替换成"机器学习",然后再问一句"是深度学习吗?"——今天几乎所有让人惊艳的 AI,答案都是"是"。

CH · 03

简史 · 六十年三起三落

A Brief History

AI 不是一夜爆红的。它已经走过 70 年,中间经历过两次几乎被彻底放弃的"寒冬"。了解这段历史,你就能看懂——为什么这一次它真的不一样。

时间线一览

年代里程碑发生了什么
1950图灵测试图灵在论文里问:机器能思考吗?提出"看不出对面是不是人"的判定法。
1956达特茅斯会议McCarthy 等人首次提出"Artificial Intelligence"这个词。AI 正式诞生。
1958感知机Rosenblatt 提出神经网络最早的雏形——感知机(Perceptron)。
1974–1980第一次寒冬能做的事太少、期望被吹得太高,政府撤资,研究陷入停滞。
1980s专家系统兴起把领域专家的知识写成规则,医院、银行开始用。短暂繁荣。
1987–1993第二次寒冬专家系统维护成本太高、扩展性差。产业再次崩盘。
1997深蓝 vs 卡斯帕罗夫IBM 深蓝击败国际象棋世界冠军。AI 首次登上大众视野。
2012AlexNet深度神经网络在图像识别比赛上大幅领先。深度学习革命开始。
2016AlphaGoGoogle 的 AI 击败围棋世界冠军李世石。"人类最后的智力堡垒"被攻下。
2017TransformerGoogle 论文《Attention Is All You Need》。为大模型时代埋下地基。
2022.11ChatGPT 发布两个月一亿用户,人类第一次和 AI 自如对话。生成式 AI 时代到来。
2023–2024百模大战GPT-4、Claude、Gemini、文心、通义、DeepSeek 等纷纷登场。
2025推理模型 & 智能体o1/o3、DeepSeek-R1 等"会思考"的模型出现;AI Agent 开始能自己完成任务。
Analogy · 春夏秋冬

AI 的历史像四季轮回:——诞生新想法;——媒体狂热、公司哄抢;——落地遇困难;——大批研究者转行。
今天我们大概率处在夏末——技术仍在爆发,但落地和商业化的秋天也已悄悄到来。

三次浪潮,三种思路

1st

符号主义 · 1950s–1980s

信念:"智能 = 逻辑推理"。人写规则,机器执行。

代表:专家系统、Prolog 语言。

局限:世界规则写不尽,遇到新情况就傻。

2nd

统计学习 · 1990s–2010s

信念:"智能 = 从数据里找相关"。用概率和数学模型学。

代表:支持向量机(SVM)、随机森林。

局限:能学但学不深,处理不了图像那种复杂结构。

3rd

深度学习 · 2012–今天

信念:"智能 = 大量数据 + 深层网络 + 大量算力"。

代表:CNN、RNN、Transformer、大模型。

能力:从识图到生成,从聊天到写代码,无所不能——但也存在幻觉。

Note · 提示

历史告诉你一件事:每次都有人喊"这次真的不一样"——过去两次都错了。这一次到底会不会错?没人能保证。但从技术底座(Transformer、算力、数据)看,这次的"地基"确实比前两次都厚。

CH · 04

机器学习 · 让机器从数据里找规律

Machine Learning
生活场景
🍉 你去菜市场挑西瓜

你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。

整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切开过的新瓜是"泛化能力"。

机器学习的三大流派

流派英文你给它什么它学到什么典型任务
监督学习Supervised数据 + 标准答案输入 → 输出的映射垃圾邮件识别、房价预测、看片诊断
无监督学习Unsupervised只有数据,没有答案数据里的结构、群体、异常用户分群、异常检测、话题聚类
强化学习Reinforcement一个环境 + 奖励/惩罚在环境里"怎么做能得高分"下棋 AI、机器人控制、自动驾驶
自监督学习Self-supervised只给数据,自己造答案数据的深层表征大语言模型的预训练(今天的主流)
Analogy · 四种老师

监督学习:老师每题都给标答,你对着改。
无监督学习:老师不给答案,只把一堆卷子放你面前,让你自己分类。
强化学习:老师不讲课,只在你做对时说"好"、做错时说"不好",你自己摸索。
自监督学习:老师撕掉一半试卷让你补全另一半——不需要额外标注,就能从原文本里"自问自答"地学。

机器学习是怎么"学"的(四步)

1. 准备数据

收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。

2. 选一个模型

比如线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。

3. 训练 · 让参数变对

把训练数据喂进去,让模型不断修正参数,直到预测和真实答案的差距(损失)尽可能小。

4. 评估 · 用没见过的数据考它

拿测试集打分。如果考得好,说明模型"泛化"了;如果只在训练集上好,叫做过拟合——死记硬背而已。

三个必知术语

  • 特征 · Feature用来喂给模型的"输入维度"。挑西瓜时,"响声、颜色、瓜蒂"就是三个特征。
  • 标签 · Label你希望模型学到的"正确答案"。西瓜切开后的"甜/不甜"就是标签。
  • 过拟合 · Overfit模型在训练集上完美、遇到新数据就傻。就像有人只会做他做过的题。
Recap · 收束

机器学习的核心是"给经验,学规律,用规律"。今天再复杂的 AI(包括大模型),底子上仍然是这三个字:··

CH · 05

神经网络 · 借鉴大脑的一种数学结构

Neural Networks

神经网络(Neural Network)是"深度学习"的骨架。名字听起来像生物学,其实它就是一堆连在一起的数学函数——只是这种连法,恰好模仿了大脑神经元传递信号的方式。

生活场景
🎓 一场工厂流水线上的判断

想象一条饮料分拣流水线
· 第一层工人只看瓶身颜色(是绿的、红的还是透明的);
· 第二层工人根据颜色 + 瓶盖形状再分(是可乐、雪碧还是水);
· 第三层工人根据前两层的结论决定放到哪个箱子。

每个工人都很笨,只做一件小判断;但一层套一层,整条流水线就能干出很复杂的事情。

一个"神经元"到底在做什么

把神经元想象成一个会打分的小盒子

  • 输入上一层送过来的若干数字(比如"颜色 0.8、形状 0.2、大小 0.5")
  • 权重给每个输入乘一个"重要度"(这些权重就是模型要学的东西)
  • 求和把加权后的输入全加起来
  • 激活用一个非线性函数(如 ReLU、Sigmoid)决定"要不要传给下一层、传多少"
  • 输出一个数字,送给下一层的所有神经元
Analogy · 一个偏心的评委

神经元像一个评委:你的舞蹈、歌唱、才艺各得几分(输入);他心里对每项有不同偏好(权重);他把分数加起来(求和),然后决定是否让你晋级(激活)。
训练神经网络,就是不断调整每个评委的"偏好",直到整场比赛的评选结果最接近观众心中的答案。

为什么要"深"

只用一层神经元,模型只能学会最简单的规律(比如线性分类)。多加几层,网络就能逐层抽象——就像饮料流水线,越靠后的工人看到的信息越"高级":

L1

底层 · 认边缘

图像 → 直线、拐角、明暗。
文字 → 单个字符或音节。

L2

中层 · 认组件

图像 → 眼睛、鼻子、轮子。
文字 → 词、短语的意思。

L3

高层 · 认整体

图像 → 猫、车、人脸。
文字 → 一句话说的是"抱怨"还是"表扬"。

常见的几种网络"造型"

名字擅长典型应用
CNN · 卷积神经网络图像人脸识别、医学影像、抖音特效
RNN / LSTM序列早期语音识别、翻译(现在被 Transformer 取代大半)
Transformer长序列 · 语言大语言模型(GPT、Claude、DeepSeek)
GAN · 生成对抗网络造假图换脸、老照片修复、艺术风格迁移
Diffusion · 扩散模型造图 / 视频Midjourney、Stable Diffusion、Sora
Note · 提示

神经网络不是真正的大脑,它没有意识、没有神经递质、没有生物学意义上的"学习"。它只是借鉴了大脑"信号在多层之间传递"的思路,然后用纯数学把它实现了。

CH · 06

训练三部曲 · 数据、模型、损失

Data, Model & Loss

训练一个 AI,说到底就三件事:拿到数据、搭好模型、让它把答案越猜越对。任何一个 AI 项目,从教一个小学生模型到训练 GPT-4,都逃不出这三部曲。

生活场景
🎯 教一个孩子打靶

你教一个孩子打靶:
· 数据:靶子和一堆箭;
· 模型:孩子的手臂动作(瞄准、力度、呼吸);
· 损失:箭偏了靶心多远——每偏一次,你告诉他"再往左一点、再压低一点"。

他不断根据"损失"调整动作。射多了,动作定型,命中率上升。这就是训练。

第一部曲 · 数据

数据是 AI 的"食物"。有句业内名言:Garbage in, Garbage out(喂垃圾进去,只能吐垃圾出来)。数据决定了模型能力的天花板。

  • 数量GPT-4 大约用了 13 万亿个 token 训练,相当于人类所有主要网页文本。
  • 质量100 万条干净数据 > 1 亿条有噪音的数据。
  • 多样性只喂新闻,模型不会写代码;只喂英文,模型的中文就差。
  • 时效性2023 年训练的模型不知道 2024 年的事——除非之后被"更新"。

第二部曲 · 模型

模型是一个"带参数的函数"。你可以粗暴理解为:y = f(x; 参数)——输入 x(问题),经过一大堆参数运算,输出 y(答案)。

"多大的模型",通常说的就是参数量

规模参数量大约需要什么代表
几亿一台笔记本能跑BERT-base、Qwen-0.5B
几十亿 – 几百亿单张 A100 显卡Llama-7B/13B
千亿数千张 GPU 集群GPT-4、Claude、DeepSeek-V3
超大万亿 (MoE)整个数据中心GPT-4o、Gemini 1.5

第三部曲 · 损失与梯度下降

"损失(Loss)"就是模型预测得离答案有多远。训练的过程就是不断调整参数,让损失变小。用的方法叫"梯度下降",你可以想象成:

Analogy · 蒙眼下山

你被蒙上眼睛放在一座山上,任务是找到山谷(损失最低点)。你唯一能感觉到的,是脚下哪边更陡(坡度)
你就顺着最陡的方向迈一步,再感受、再迈一步——迈得太大会跳过山谷(学习率过大),迈得太小要走很久(学习率过小)。
迈够多步,你就到谷底了。这就是梯度下降

大模型训练的三阶段(分开记)

1. 预训练 · Pre-training

喂海量文本(几万亿字),让模型学会"预测下一个词"。这一步做完,它已经知道很多知识,但还不太会"聊天"。

2. 指令微调 · SFT

给它示范"人类的问答对"——你问什么、我应该怎么答。它开始像 ChatGPT 那样对话。

3. 对齐 · RLHF / DPO

用人类的偏好反馈来教它"哪种回答更有用、更礼貌、更安全"。这一步让它变得"讨人喜欢"。

可选:强化学习推理训练

2025 年新趋势(如 DeepSeek-R1、o1)。通过强化学习让模型自己"多想几步再回答",专门提升推理能力。

Note · 一个关键直觉

训练 GPT-4 这样的模型,据估算需要数千万美元算力费;但训完之后推理(就是你每次和它对话)的成本只有几厘钱。训练像盖楼,推理像入住——盖一次很贵,之后天天用便宜。

CH · 07

Transformer · 让 AI 会"读句子"的那块砖

The Transformer

2017 年,Google 一篇叫《Attention Is All You Need》的论文,扔出一个叫 Transformer 的新结构。没有这块砖,就没有今天的 ChatGPT。ChatGPT 里的那个 "T",指的正是它。

生活场景
📖 你读一句话时,眼睛是怎么工作的

"他把苹果放在桌上,然后咬了一口"
你一读到"它",脑子里立刻联想到"苹果"而不是"桌子"。为什么?因为你在读"它"的时候,眼睛并不是只看这一个字,而是回过头扫了一遍整句话,找到最相关的那个词。

为什么 Transformer 这么关键

在 Transformer 之前,AI 处理语言用的是 RNN/LSTM 这一类模型——它们像阅读一列排队入场的人,只能一个一个地读,前面的人走远了就容易忘。句子一长就抓不住重点。

Transformer 改成了另一种方式:把整句话摊在桌面上,每个词都能同时看到其他所有词。这让它有两个巨大的优势:

01

更懂长距离关系

"它"能一眼锁定十几个字之前的"苹果",不再靠一个个传话。

02

能大规模并行

整个句子同时处理,训练速度远高于 RNN。GPU 因此能被榨到极致——这才让"千亿参数模型"变得可能。

Attention · 用大白话拆一遍

对每个词,模型都做三件事:

  • Query(我是谁)生成一个"我要找什么"的向量。
  • Key(我这里有什么)句子里每个词都有一个"我是什么"的向量。
  • Value(我能给什么)每个词的"内容"本身,等着被取用。

模型用 Query 跟所有 Key 对一遍分(谁跟我最相关),然后按分数把 Value 加权汇总——这就是"这一个词此刻理解到的意思"。整句话都这么处理一遍,就是一层 Attention。

Analogy · 图书馆检索

你(Query)走进图书馆,说"我想查关于苹果的事"。图书馆里每本书都有一张目录卡(Key),你依次比对相关度;找到最相关的那几本后,把它们的内容(Value)带回来读。
Transformer 一层 Attention,就是句子里每个词都跑一趟图书馆

再叠一叠 · 多头 + 多层

  • 多头 · Multi-head一个词可以同时从不同角度关注句子("语法角度""语义角度""指代角度"),多头就是多个平行的 Attention。
  • 多层 · Stack把这样的 Attention 层叠 12 层、96 层、甚至几百层,就得到了大模型的"深度"。

Transformer 家族树

变种特点代表模型
Encoder-only只做"理解",不生成BERT(早期搜索/分类的宠儿)
Decoder-only只做"生成",一直往后写GPT 系列、Claude、DeepSeek
Encoder-Decoder先理解,再生成T5、原始翻译模型
MoE · 专家混合不激活全部参数,只叫醒几个"专家"Mixtral、DeepSeek-V3
Recap · 一句话

Transformer = "注意力机制 × 堆叠层数 × 并行计算"。它让机器第一次能真正"读长句子",从此打开了通往大模型的门。

CH · 08

大语言模型 · 它到底怎么"想"的

How LLMs Actually Think

你在 DeepSeek 里问一个问题,它秒回一段流利的中文——你会以为它"懂"你。其实它没有懂,它只是在一个字一个字地猜"下一个词最像什么",猜得极其快、极其准而已。这一章就把这个"猜"讲透。

核心秘密 · 一个词一个词地接龙

大语言模型(LLM)的本质任务只有一个:给出前面已经有的文字,预测下一个 token 最可能是什么

Token 是模型眼里的"字",通常一个 token ≈ 半个到一个汉字,或 3-4 个英文字母。整句话就是几十上百个 token 排队。

现场演示
🔤 你问:"中国的首都是"

模型在心里给候选词打分:
· "北京" → 概率 96%
· "上海" → 概率 2%
· "长安" → 概率 1%
· "薯条" → 概率 0.0001%

它挑一个(通常是概率最高的),输出。然后把"北京"接到句子后面,再问一次"接下来最可能是啥?"——如此循环,一直生成到句号。

那它"懂"吗?争论的两派

A

不懂派 · 随机鹦鹉

Emily Bender 等语言学家说:LLM 只是"随机鹦鹉"(Stochastic Parrot),它靠统计规律把词接在一起,没有真正的语义理解。

B

懂了派 · 涌现智能

OpenAI、Anthropic 等则认为:当模型足够大、数据足够多,它内部会"涌现"出对世界的建模能力,虽然机制不同于人脑,但功能上确实在"理解"。

目前主流看法:比"随机鹦鹉"多一点,比"真的理解"少一点。它在语言层面有强大的"操作能力",但缺乏对物理世界、时间流逝、因果关系的真实感受。

影响回答质量的几个"旋钮"

  • Temperature · 温度决定它"多敢乱猜"。0 时永远选概率最高的词(很死板);1 时按概率分布随机采样(更有创意)。
  • Top-p / Top-k只从概率前几名里挑,防止它跑偏。
  • Context Window · 上下文窗口它一次能"看到"多少 token。今天主流是 128K–1M。太长会忘掉前面。
  • System Prompt · 系统指令对话最开始的一段"你要扮演谁"的提示,决定了它整段对话的语气。

常听到的几种 LLM 术语,一次讲清

术语含义类比
Pre-training · 预训练喂海量互联网文本,学会预测下一个词从小读万卷书
Fine-tuning · 微调用少量领域数据,把通用模型改造成专业选手大学毕业后专业培训
RLHF用人类反馈做强化学习,让答案更符合人的偏好教练在旁边点头/摇头
RAG · 检索增强先查资料再回答,避免瞎编开卷考试
Distillation · 蒸馏让小模型模仿大模型的行为徒弟学师傅招式
Quantization · 量化把参数从高精度压成低精度,模型变小但略掉点性能把 4K 视频压成 1080P
Chain of Thought · 思维链让模型"一步步想"再回答,能显著提升推理写草稿再誊抄
Reasoning Model · 推理模型专门用 RL 训练"多想几步"的新一代模型会打草稿的学霸(o1, R1)
Note · 提示

下次别人对你说"AI 好厉害,好像真的在思考"时,你可以在心里想:它是在做一个天文数字级别的"填空题"——只是这个填空题背后连着的规律,已经足够复杂,复杂到我们看它像人。

CH · 09

多模态 · 看图、听声、生视频

Multimodal AI

"多模态"意思是:AI 不再只处理文字,还能看图、听声、看视频、甚至生成它们。这是过去两年 AI 圈最热闹的方向——你熟悉的 Sora、Midjourney、GPT-4o 都属于这一类。

生活场景
🎬 你和朋友刷抖音

一条 15 秒的视频里,你的大脑同时在处理:画面(人在跳舞)、声音(音乐节奏)、文字(字幕)、动作(配合镜头切换)。人脑天生就是多模态的——现在的 AI,也开始学着"用多种感官同时看世界"。

核心思路 · 都变成"向量"

不管是图像、声音还是文字,AI 处理它们的第一步都一样:翻译成一串数字(向量)。这一步叫"嵌入(Embedding)"。

  • 文字 → 向量"猫" 变成 [0.12, -0.55, 0.83, ...]
  • 图像 → 向量一张猫的图片,也变成同样维度的一串数字
  • 语音 → 向量一段"喵喵叫"的音频,也变成一串数字

神奇的是,如果训练得好,这三串数字在"向量空间"里会靠得很近——因为它们都指向同一个概念"猫"。这就是多模态的地基。

Analogy · 世界语

想象所有信息(图、字、声)被翻译成同一门"世界语"(向量)。之后 AI 无论输入是什么,都在同一个"语言"里进行推理和转换。
把图翻成字 → 图生文;把字翻成图 → 文生图;把字翻成音 → 文生音——都是同一套思路。

主流的四类"生成 AI"

01

文本 · Text

ChatGPT、DeepSeek、Claude、通义千问。基座是 Transformer 大语言模型。

02

图像 · Image

Midjourney、Stable Diffusion、Flux、可灵图片。核心技术:扩散模型(Diffusion)。

03

视频 · Video

Sora、可灵、即梦、Runway。原理是"图像扩散 + 时间维度",一次生成几秒到几十秒。

04

语音 · Audio

Suno(歌曲)、ElevenLabs(配音)、GPT-4o Voice(对话)。

扩散模型 · 图像 AI 是怎么"画"的

直觉上你以为 AI 是"画"图,其实它是"从一堆雪花中反向擦出图像"

1. 一张噪声图

先给一张纯"电视雪花"式的图(完全随机像素)。

2. 模型看提示词

比如"一只在草地上的橘猫"。

3. 一步步"擦"掉噪声

每一步模型都猜:如果最终是一只橘猫,那这一步该去掉多少噪声、往哪个方向修。

4. 20–50 步后

雪花逐渐变成一只清晰的橘猫。图,就这么"擦"出来了。

视频生成为什么这么难

  • 帧一致性每一帧都要合理,前后帧还要连贯。人物脸不能上一秒是长发下一秒短发。
  • 物理常识杯子倒下水要洒出来。AI 常在这里翻车。
  • 算力吃紧1 秒视频 = 24 帧图。生成 10 秒视频,就是 240 张相互约束的图。
  • 时长限制目前主流上限 10–60 秒。生成一部电影仍然遥远。
Recap · 收束

多模态的关键是"同一个向量空间"。理解了这一点,你就明白为什么 GPT-4o 能同时看图、听声、说话——因为对它来说,这些东西说到底都是一串数字。

CH · 10

提示词工程 · 会问,比会用更重要

Prompt Engineering

"同样一个 AI,为什么别人用起来神通广大,我用起来废话连篇?"——差距往往不在模型,而在提问。这一章教你怎么问。

生活场景
🍔 你去餐厅点餐

你对服务员说"随便来点吃的"——上来一盘白饭。
你说"来份牛肉盖饭,米饭少一点,牛肉多要点,加一个煎蛋七分熟,不要葱花"——正合胃口。
对 AI 说话也一样:信息越具体、要求越明确,你得到的东西就越接近你想要的

一个好提示词的五要素

要素作用举例
角色 · Role让 AI 站在合适的立场"你是一位资深初中数学老师……"
任务 · Task明确要它做什么"请把下面这道二次方程题讲给一个九年级学生听"
输入 · Input提供必需的原始素材题目原文、要分析的段落、要翻译的原文……
要求 · Constraints限制风格、长度、格式"分三步、不要用专业术语、控制在 300 字以内"
格式 · Format指定输出结构"用 Markdown 表格返回、每行一条"

三个立刻能用的写法模板

模板 1 · 角色 + 任务

你是【一名 XX 领域的专家】。请【完成一件具体的事】。要求:
1. ......
2. ......
3. ......

模板 2 · 少样本示范(Few-shot)

下面是几个例子:
输入:X1 → 输出:Y1
输入:X2 → 输出:Y2
现在轮到你:
输入:X3 → 输出:?

——给它两三个例子,比讲一百句话都管用。

模板 3 · 一步步想(Chain-of-Thought)

请一步步思考再给出答案。先写出你的推理过程,再给最后结论。
——对数学、逻辑、代码类问题,这一句能显著减少错误。

十条私藏心法

  • 01 明确受众"讲给一个 8 岁小孩听"和"讲给博士生听",答案天差地别。
  • 02 给它角色"你是……"能激活模型对应的知识分布。
  • 03 用示例代替解释给两个例子比写五百字要求管用。
  • 04 一次一件事别把"总结 + 翻译 + 找错 + 出题"堆在一个提示里。
  • 05 让它先复述"先复述我的要求,再开始答题"——能减少偏题。
  • 06 给它打分标准"好答案的标准是:A + B + C",它就会照这个标准写。
  • 07 让它慢慢想"一步步思考"、"先列大纲再写正文"。
  • 08 输出结构化让它输出 JSON、表格、Markdown,方便你处理。
  • 09 允许它说不知道"如果不确定就说不知道"——降低幻觉。
  • 10 迭代式对话第一次答不好没关系,指出问题让它再改一版。

常见反面教材

"帮我写点东西"

没主题、没长度、没风格、没受众。AI 只能瞎写。

"翻译一下"

翻成哪种语言?正式还是口语?给别人看还是自用?都没说。

"这段代码有什么问题"

要指出 bug?要重写?要加注释?请明确目的。

Recap · 一句话

你的提示词质量决定了 AI 回答的天花板。"提示词工程"不是什么玄学,就是"把话说清楚"这件小学生功夫,只是现在有了新用武之地

CH · 11

AI 智能体 · 从"回答问题"到"自己干活"

AI Agents

2024 年之后,AI 圈最火的词从"大模型"变成了"Agent(智能体)"。它不再只是回答你一句"这个怎么做",而是自己动手把这件事做完——查资料、写文档、订机票、跑代码、装软件……

生活场景
🧑‍💼 从"问导购"到"雇助理"

普通聊天 AI:你问导购"这双鞋怎么样",他答一句话,然后等你下一句问题。
AI 智能体:你雇了一个私人助理,说"帮我买一双去日本要穿的防水徒步鞋,预算 800,明天到"。他自己去网站搜、比价、看评论、下单、跟踪物流,做完再回来告诉你结果。

一个 Agent 的四个零件

01

大脑 · LLM

负责思考、规划、决策。用的是 GPT / Claude / DeepSeek 这类大模型。

02

记忆 · Memory

短期:本次对话上下文;长期:把重要信息存到数据库,之后能查回来。

03

工具 · Tools

能调用外部功能:浏览网页、执行代码、查数据库、发邮件、订机票、控制电脑鼠标。

04

循环 · Loop

"思考→用工具→看结果→再思考",直到任务完成。就像人做事的心里循环。

它是怎么"自己干活"的(ReAct 模式)

今天大多数 Agent 用一种叫 ReAct(Reason + Act)的思路,反复三步:

Thought · 想

"用户要我订机票。我需要先查航班。"

Action · 做

调用"搜索航班"这个工具,参数:北京→东京,7月20日。

Observation · 看

工具返回一堆航班列表。

循环

回到"想"这一步:"下一步我要挑一个便宜且时间合适的。"…… 如此循环直到订好票。

典型的 Agent 产品长什么样

类型代表产品能干的事
通用助理ChatGPT (with Agent mode)、Claude Computer Use、Manus浏览网页、写文档、订东西
编程 AgentTRAE、Cursor、Devin、Cline读懂整个项目、写代码、跑测试、修 bug
研究 AgentPerplexity、GPT Deep Research自动多轮搜索、整理成一份研究报告
数据分析Julius、Advanced Data Analysis上传表格自动出图、跑统计
行业 Agent各类客服、法务、医疗 Copilot结合企业知识库,替员工分担重复工作

三个新兴关键词

  • RAG · 检索增强生成先"查资料",再回答。让 AI 用你自己的文档、公司知识库、最新新闻回答——大幅降低幻觉。
  • MCP · 模型上下文协议让不同 AI 应用能调用同一批工具的"通用接口标准",2024 年由 Anthropic 提出,正在快速普及。
  • Multi-Agent · 多智能体协作让多个 Agent 分工——一个当"经理"、一个当"程序员"、一个当"审校",像一个小公司。
Note · 提示

Agent 是 2025 年 AI 落地的核心趋势,但它仍然经常翻车——中途卡住、逻辑跑偏、把网页看错。它更适合"重复但不严肃"的任务,重要事情务必人工复核。

CH · 12

AI 生态地图 · 你听过的那些名字是干嘛的

The AI Landscape

OpenAI、Anthropic、DeepSeek、英伟达、Hugging Face……你在新闻里天天看到这些名字,但它们到底做什么?这一章帮你在心里画一张 AI 世界的地图

产业分层 · 从底到顶

做什么代表玩家
芯片 · Hardware造 GPU 芯片,AI 的"能量来源"NVIDIA、AMD、华为昇腾、寒武纪
算力云 · Cloud租 GPU 集群给别人训练模型AWS、Azure、GCP、阿里云、火山引擎
基础模型 · Foundation训练出通用大模型(万亿参数)OpenAI、Anthropic、Google、DeepSeek、Meta、Mistral
开源社区 · Open发布免费权重、提供工具Hugging Face、Meta Llama、Qwen、DeepSeek 开源版
基础设施 · Infra做训练/推理框架、向量数据库、Agent 框架PyTorch、vLLM、LangChain、Pinecone
应用层 · App把大模型包装成产品给普通用户ChatGPT、Claude、Perplexity、Midjourney、Cursor、TRAE
行业方案 · Vertical专门服务某一个行业医疗影像 AI、法律 AI、教育 AI、金融风控

大模型花名册(截至 2026)

US

美国阵营

OpenAI · GPT-4o / o3 / o4,行业标杆
Anthropic · Claude,长文本与安全性见长
Google · Gemini,多模态与超长上下文
Meta · Llama,开源模型的旗手
xAI · Grok,Elon Musk 主导

CN

中国阵营

DeepSeek · 深度求索,高性价比与推理见长
Qwen · 通义千问 · 阿里,开源生态强
豆包 / Doubao · 字节,超大规模用户
文心一言 · 百度
Kimi · 月之暗面,长文本擅长
智谱清言 · GLM · 清华系

EU

欧洲与其他

Mistral · 法国,开源与效率
Cohere · 加拿大,企业市场
Nvidia NIM · 提供推理服务

OSS

开源明星

Llama 系列、Qwen 系列、DeepSeek-V3/R1、Mistral、Phi、Gemma——你能在家跑的都在这里。

图像 / 视频 / 语音方向的玩家

方向代表产品擅长
文生图Midjourney、Flux、Stable Diffusion、可灵图片艺术风格
文生视频Sora、可灵、Runway、即梦、Veo短视频、创意广告
图 / 视频编辑Adobe Firefly、Pika、Pixverse精细化编辑
音乐生成Suno、Udio整首歌一键生成
配音 / 克隆声ElevenLabs、火山引擎、字节剪映拟人声、多语言

你需要认识的开发者工具

  • Hugging FaceAI 界的 GitHub,找模型和数据集就上这里。
  • Ollama一行命令在本机跑 Llama、Qwen、DeepSeek,隐私和折腾兼得。
  • LangChain / LlamaIndex给开发者搭 Agent、RAG 应用用的框架。
  • Cursor / TRAE / ClineAI 原生编辑器,写代码效率飞跃。
  • Perplexity带引用的 AI 搜索——写论文查资料的新入口。
Recap · 记住"三个层"

下次听到一个新 AI 公司/产品,问自己一个问题就够了——它在哪一层?是造模型?造应用?还是行业方案?分清了这一点,很多新闻里的"AI 大战"就不再乱成一锅粥。

CH · 13

AI 的局限 · 幻觉、偏见与它不会的东西

The Limits

学 AI,光看它的"厉害"是不够的。你必须知道它在哪些地方会翻车——这决定了你什么时候能信它、什么时候必须自己再看一眼。

局限一 · 幻觉(Hallucination)

AI 会一本正经地胡说八道:编造参考文献、伪造名人名言、把两个人的经历拼在一起。这不是它故意的——它是"预测下一个词"的机制决定的:只要那个词看起来合理,它就说出来,哪怕事实上根本不存在。

典型翻车
📚 律师引用了 AI 编的判例

2023 年美国一位律师用 ChatGPT 写辩护词,AI 引用了 6 个"看起来很真"的判例。律师没核对就交了法庭——结果全是编的。律师被罚款、名誉受损。

怎么降低幻觉?

  • 让它有依据给它资料让它"引用"(这就是 RAG)。
  • 允许它说不知道"如果不确定就说'我不确定'"。
  • 让它多想使用推理模型(o1、R1),或加"一步步想"提示。
  • 追问来源"你的这个数据来自哪里?给我原文链接。"

局限二 · 偏见(Bias)

AI 从互联网学习,互联网上有什么,它就学什么——包括各种性别、种族、地域的偏见。它对某些群体的回答可能不知不觉地带有刻板印象

常见表现:护士默认是女性、CEO 默认是男性;某些国家名字关联负面语义;生成图像时特定职业总是特定人种。

局限三 · 时效性

模型训练数据有截止日期。如果你问它今年发生的事、最新的新闻、最新版软件的用法——它可能一无所知,或者用旧信息瞎编。带"联网搜索"的模型好一些,但也不是每次都触发。

局限四 · 它不擅长的活

精确数学

大数加减、多位数乘除、复杂公式,它常常翻车。让它调工具(计算器 / 代码)会好很多。

实时信息

股票价格、比赛比分、天气——没联网时它会瞎猜。

物理常识

"把水杯倒过来,水会怎样"——它答对但生成视频常出错,因为它不"体验"重力。

长逻辑链

需要 20 步以上的严密推理,它会中途丢线索。

局限五 · 隐私、版权与安全

  • 隐私你输入的东西可能被用来训练模型。敏感信息(身份证、银行卡、公司机密)绝对不要粘到公共 AI 里
  • 版权AI 生成的内容归谁?训练用的原始数据版权怎么算?法律仍在追赶技术。
  • 深度伪造换脸、AI 换声电话诈骗、AI 合成的假新闻——2024 年起已是社会问题。
  • Prompt 注入恶意用户可以骗过 Agent 让它做不该做的事。企业部署 AI 时必须防这个。
Analogy · 一个博学但不上心的实习生

把 AI 想成一个博学但不上心的实习生
· 他知识面很广——可以放心让他起草;
· 他会瞎编数字——重要事情你必须自己核;
· 他没有职业操守——不要给他公司机密;
· 他会讨你欢心说好听的——你要有自己的判断力。

Note · 一个铁律

用 AI 时永远记住一句话:"AI 的输出是草稿,不是终稿"。让它替你把 80% 的活干完,剩下 20% 靠你自己的判断收尾——这样效率最高、风险最低。

CH · 14

与 AI 共处 · 学习、工作与未来

Living With AI

最后一章,我想以老师的身份和你说几句心里话。AI 会怎么改变你的学习、工作和生活?与其焦虑"我会不会被替代",不如学会"和它一起把事做好"

三个必须先想清楚的问题

Q1

AI 会取代我的工作吗?

短期内被 AI 全盘替代的工种其实很少;但不会用 AI 的人会被会用 AI 的人替代。这是几乎所有行业分析的共识。

Q2

我还需要学 XX 吗?

需要。AI 帮你干活,但它会瞎编——你要有能力判断它对不对。基础知识、专业判断力、批判性思维,比过去更重要。

Q3

孩子从小该不该接触 AI?

该。但重点不是让孩子"用 AI 代写作业",而是让他学会怎么问、怎么核实、怎么判断——这是新时代的读写能力。

与 AI 相处的四种姿势

姿势什么意思结果
拒绝"这东西不可靠",坚决不用短期舒服,长期被淘汰
迷信"AI 说什么都是对的",全盘照搬被幻觉坑,还失去判断力
玩具只用来写段子、生表情包浪费了它的真正生产力
协同 ✓把 AI 当"实习生 + 助理 + 陪练"效率翻倍、能力反而更强

把 AI 变成"你的私人老师"(学习场景)

  • 当讲师"用我能听懂的话讲一遍 XX 概念,配一个生活例子"
  • 当出题"围绕这个知识点出 5 道选择题,一道综合题,附答案解析"
  • 当陪练"你扮演面试官/客户/口语搭子,跟我角色扮演 5 轮"
  • 当纠错"这是我的作文/代码/论证,请找出问题并给出改进建议"
  • 当翻译"帮我把这段英文论文翻成中文,专业术语保留原文并加注解"

把 AI 变成"你的助手"(工作场景)

  • 写作先自己写 30% 思路,让 AI 扩写;再自己改;再让它润色。三轮下来又快又稳。
  • 阅读把长报告丢给它总结要点、抽出数据、生成脑图。
  • 编程用 Cursor / TRAE 这类 AI 编辑器,写代码效率能提升 2–3 倍。
  • 研究Perplexity 找资料、Claude 分析、Gemini 处理长文档——组合拳最猛。
  • 重复劳动批量改标题、批量分类邮件、批量整理表格——一个提示词能替你干半天。

三条我希望你记住的话

Say · 1

AI 是放大器,不是替代品。它会把有能力的人放大成"超级个体",也会把想偷懒的人放大成"更懒的人"。你想要哪一种,取决于你怎么用它。

Say · 2

提问的能力,比记忆的能力更重要。过去我们比谁记得多、算得快,未来我们比谁能问出好问题、判断出对错。这是一次能力的重估

Say · 3

保持人类的部分。AI 能写文字、能生成图,但它不能替你去恋爱、去带孩子、去感受一场雨、去写下"我此刻的心情"。留下这些不能被替代的部分,是我们对抗被工具异化的底牌。

Recap · 全篇收束

回到最开始那句话——AI 就是一个"读过整座图书馆的孩子"。你已经知道了它的原理、能力、局限、以及怎么用它。
从今天起,它不再是新闻里那个神秘的名词,而是你桌上一个能被你用得很好的工具
祝你玩得开心,也用得有分寸。