学 海 无 涯
网 络 篇
序章 · 网络是什么
网络(Network),本质上不过是"让两台机器能说上话"的一整套约定与设施。你手中的手机、桌上的电脑、远在天边的服务器——只要它们之间能传递信息,就构成了网络。
先看你现在正在发生的事
此刻你正在浏览 xuehai-wuya.pages.dev 这个页面。你有没有想过,这背后其实发生了这些事?
你的手机 / 电脑
发出一个"我想看这个网站"的请求。
路由器 / 运营商
把请求转出去,穿越好几台"中转站"(路由器)。
DNS 翻译
把 xuehai-wuya.pages.dev 这个名字翻译成一串数字(IP),机器只认数字。
Cloudflare 服务器
某台在离你最近城市的机房里的服务器,收到你的请求。
返回网页
服务器把 HTML 顺着原路送回,你的浏览器把它渲染成你看到的样子。
短短几百毫秒之内,全球可能穿越了几十台设备。本篇要做的,就是让你逐步看懂这一切。
一句话理解
把网络想象成一条条看不见的公路:路面(物理线路)、交通规则(协议)、门牌号(IP 地址)、目的地房间号(端口)、快递员(路由器)——所有这些加在一起,才让"你发一条消息,对方能收到"这件事成立。
寄一封信:你在信封上写下"某市某街某号(IP)张三收(端口)",投进邮筒(发送);邮局按流程分拣、转运(路由);最终送到收信人手上(接收)。网络传输,几乎就是这整个过程的电子版。
为什么要学网络
看懂"日常"
WiFi 为何断线、网页为何打不开、扫码为何转圈——理解原理便不再玄学。
解决问题
路由器该如何配置、DNS 为什么要换、VPN 究竟是什么——都能自己判断。
拓展视野
从聊天软件到 AI 大模型,几乎所有互联网产品的底层都躺着这套逻辑。
基础概念 · 主机、协议与地址
此刻你在餐桌前,手机是点单方;美团的机房里有一台机器负责接单,是接单方;订单能顺利到达,是因为你们双方遵守同一份"下单规则"——什么时候写地址、什么时候填联系方式、错误怎么处理,规则清清楚楚。
网络里也一样,需要三样东西:参与者、规则、身份标识。
入门先要认识三个最常听到的词:主机、协议、地址。它们像"参与者、规则、身份证",缺一不可。
三个最基础的概念
| 术语 | 英文 | 通俗理解 | 举例 |
|---|---|---|---|
| 主机 | Host | 联网的任何一台设备 | 手机、电脑、服务器、智能音箱 |
| 协议 | Protocol | 双方约定好的说话规则 | HTTP、TCP、DNS |
| 地址 | Address | 一台设备的身份编号 | 192.168.1.1(IP)、a4:5e:...(MAC) |
| 客户端 | Client | 发起请求的那一方 | 你的浏览器 |
| 服务器 | Server | 提供服务、响应请求的那一方 | 百度的机房 |
| 数据包 | Packet | 被拆成小块的信息 | 一张图片可能被拆成上千个包 |
"协议"是网络学习中最重要的一个词。凡是双方需要交换信息,就必然存在某种协议。只要理解了"协议是一份约定书",后面所有 HTTP、TCP、IP 都不难理解。
分层模型 · OSI 与 TCP/IP
你在网上买了个东西,从美国仓库寄到你家。这个包裹的旅行是分层的:
① 你只在乎"东西好不好用";
② 商家负责打包、贴单;
③ 物流公司负责选路线、转运;
④ 飞机 / 卡车 / 快递员负责真的把箱子搬过来。
每一层只操心自己的事——你不用知道飞机什么型号,快递员也不需要知道你买了什么。这就是"分层"的智慧。
网络之所以能运作,是因为把一件"从一台机器传数据到另一台机器"的复杂事,切成一层一层的小事,每一层只操心自己那一块。上层不必知道下层怎么做,下层也不必理会上层内容是什么。
OSI 七层模型(学院派参考)
1984 年国际标准化组织提出的经典模型,把网络分成七层。虽然实际很少完全按七层实现,但它是理解网络的最佳教学地图。
TCP/IP 四层模型(工程实用版)
互联网工程中实际使用的模型更精简:应用层 → 传输层 → 网络层 → 网络接口层。它是 OSI 七层的"合并简化版",也是你以后遇到最多的说法。
常见协议 · 一览通用语言
你会中文,对方会英文。要交流,就得约定一种共同语言——是英文?是普通话?是手语?这叫"协议"。
网络里的"协议"就是这个意思——两台机器约定用什么方式说话。看网页用一种方式(HTTP),发邮件用另一种(SMTP),视频通话又不一样(RTP/UDP)。
协议是"网络的语言"。日常你会反复看到这些缩写,先建立最粗略的印象即可:
| 协议 | 层级 | 作用 | 你可能见过它 |
|---|---|---|---|
HTTP / HTTPS | 应用层 | 网页内容传输 | 浏览器地址栏 https:// |
DNS | 应用层 | 把域名翻译成 IP | 把 baidu.com 变成 110.242.68.66 |
SMTP / IMAP | 应用层 | 收发邮件 | 邮件客户端配置 |
SSH | 应用层 | 安全远程登录 | 程序员登录服务器 |
TCP | 传输层 | 可靠、有序、按字节流传输 | 网页、聊天、文件下载 |
UDP | 传输层 | 快速、不保证到达 | 视频通话、游戏、直播 |
IP | 网络层 | 寻址与路由 | 你的公网 IP |
ARP | 链路层 | 由 IP 找到 MAC 地址 | 局域网内互相识别 |
TCP vs UDP:TCP 像挂号信,逐件签收、丢了会补寄;UDP 像广播喇叭,说一次就过去,丢了就丢了。视频聊天宁可掉几帧也不能卡顿,所以偏爱 UDP;网页则要求内容完整,所以用 TCP。
IP 与端口 · 门牌与房间
你要寄东西给一位朋友,光写"北京市朝阳区某某大厦"够吗?不够——大厦里有上千人,快递员不知道送给谁。
你还得写"1503 室 张三",快递才能真正送到人手上。
把这套逻辑搬到网络里:
· IP 地址 = 那栋"大厦的地址",用来找到哪台机器;
· 端口 = 大厦里的"房间号",用来找到那台机器上的哪个程序。
如果说 IP 地址是一栋楼的门牌号,那 端口就是这栋楼里的具体房间号。数据要送达,必须知道"送到哪栋楼的哪个房间"。
IP 地址
四段数字
如 192.168.1.1,共约 43 亿个地址,早已不够用。
八段十六进制
如 2001:db8::1,地址空间几乎无限,正在逐步普及。
局域网内使用
家里的 192.168.x.x、10.x.x.x——只在本地有效。
互联网上唯一
由运营商分配,能被外网访问到。
端口
端口是 0 – 65535 的一个数字,用来区分"同一台机器上运行的不同程序"。几个你必须眼熟的默认端口:
| 端口 | 协议 | 用途 |
|---|---|---|
80 | HTTP | 普通网页 |
443 | HTTPS | 加密网页 |
22 | SSH | 远程登录 |
53 | DNS | 域名解析 |
3306 | — | MySQL 数据库默认端口 |
一次访问的旅程 · 从输入网址到看到网页
你要去一位朋友家,只知道名字不知道详细地址。你会怎么做?
① 打电话问朋友要地址(把名字变成地址);
② 打开滴滴,输入地址、叫车(建立联系);
③ 上车、跟司机说"走吧"(发出请求);
④ 司机开过去,把你送到(响应到达);
⑤ 到了门口,敲门进去看到朋友(把内容呈现出来)。
你在浏览器输入 www.baidu.com 到看到百度首页——背后发生的事,几乎是这五步的电子版。
以你在浏览器输入 www.baidu.com 为例,短短几百毫秒之内,其实发生了六个关键动作。看懂这一段,等于把前面所有概念串成一条线。
域名解析(DNS)
浏览器把 www.baidu.com 交给 DNS,问:"这个名字对应哪个 IP?"很快收到答案,比如 110.242.68.66。
建立 TCP 连接(三次握手)
浏览器与服务器互相确认:"我要说话(SYN)— 我收到,我也要说(SYN+ACK)— 好,我们说吧(ACK)"。此时通道建成。
TLS 加密握手(若是 HTTPS)
双方协商加密算法、交换密钥,让后续内容不被中间人偷看。
发送 HTTP 请求
浏览器发出:GET / HTTP/1.1,告诉服务器"给我首页"。
服务器响应
服务器返回 HTML、CSS、JS、图片等资源,携带状态码(200 OK 表示成功)。
浏览器渲染
浏览器把收到的代码解析、绘制成你看到的网页,完成整个旅程。
网络设备 · 数据的驿站
你在北京寄一个包裹去深圳,快递不会直接飞过去。它会经过:
· 小区门口的丰巢柜(临时收件点)
· 市内分拣中心(按目的地分堆)
· 机场 / 高铁站(干线运输)
· 深圳的分拣中心(再分堆)
· 快递员的电动车(最后一公里)
网络数据的旅程一模一样,只不过"驿站"变成了各种设备:路由器、交换机、防火墙、网关——每个都有自己的分工。
数据从你到远方,中间要经过若干"驿站"。它们各自分工:
集线器
最原始,只会广播——早已被淘汰,了解即可。
交换机
工作在链路层,按 MAC 地址在局域网内精准转发。
路由器
工作在网络层,按 IP 地址跨网络转发——家里那台"猫盒子"就是它。
防火墙
按规则允许/拦截数据包,是网络的守门人。
网关
连接两个不同网络的"桥",家用路由器同时充当网关。
无线接入点
把有线信号转成 WiFi 信号,让手机、笔记本无线上网。
到此,你已完成一次从概念 → 模型 → 协议 → 地址 → 旅程 → 设备的完整巡礼。剩下的深入话题——安全、无线、云——会作为独立章节陆续加入。
HTTP 深读 · 请求、方法与状态码
你走进星巴克,跟店员的对话是这样的:
你:"请给我一杯拿铁,热的,中杯。"(请求)
店员:"好的,等一下。"(确认收到)
…片刻后…
店员:"您的拿铁好了,请拿走。"(响应)
浏览器向服务器要网页,就是这套"点单 → 上菜"的循环。这个循环用的"点单话术"就叫 HTTP。
HTTP(HyperText Transfer Protocol,超文本传输协议)是你每天点开一个网页时,浏览器与服务器之间讲的那门语言。它简单、直白、几乎无处不在。
一次 HTTP 对话长什么样
本质上就是"客户端问 → 服务器答",两段纯文本:
请求由 起始行 + 头部字段 + 空行 + 可选正文 组成;响应同样如此。看似简陋,却是撑起整个 Web 的骨架。
常用 HTTP 方法
| 方法 | 语义 | 典型场景 | 是否幂等 |
|---|---|---|---|
GET | 读取资源 | 打开网页、查询数据 | 是 |
POST | 提交新数据 | 登录、发帖、上传 | 否 |
PUT | 整体替换资源 | 更新用户资料 | 是 |
PATCH | 局部修改 | 只改一个字段 | 否 |
DELETE | 删除资源 | 删帖、注销 | 是 |
HEAD | 只取响应头,不要正文 | 探测资源是否存在 | 是 |
OPTIONS | 询问服务器支持什么 | 跨域预检 | 是 |
"幂等"意思是:同一个请求,做一次和做一百次结果一样。GET 只是读、不会变;DELETE 删过就是删过,再删也是"没有"。而 POST 每一次都会新增一条数据,所以不幂等。
状态码 · 五个家族
响应的第一行有一个三位数字,用百位划分家族,看百位就能猜出七八分:
常见头部字段
- Host目标网站的域名,一台服务器可挂多个网站
- User-Agent浏览器/客户端身份标识
- Content-Type正文数据类型,如
application/json - Cookie客户端存的小凭证,登录状态就靠它
- Authorization带 Token 的身份认证
- Cache-Control缓存策略,控制多久重新拉取
HTTP 版本演进
DNS 深读 · 名字如何变成地址
你要联系"北京大学招生办",但只记得名字,不记得电话号码。怎么办?
拨 114 查号台,告诉他名字,他一层层帮你查——先查是哪所学校,再查招生办的号码,最后把电话回给你。
你记得住 baidu.com、weibo.com 这些名字,但机器只认数字(比如 110.242.68.66)。DNS 就是互联网上的 114 查号台,把"名字"翻译成"数字"。
DNS(Domain Name System,域名系统)是互联网的"电话簿"——你只记得住 baidu.com 这样的名字,机器却只认 110.242.68.66 这样的数字,DNS 负责在二者之间来回翻译。
为什么要有 DNS
人类的记忆是"语义型"的:容易记住 zhihu.com,很难记住 103.41.167.234。而且,同一个网站背后可能有几十上百台服务器 IP,还会变来变去;DNS 让你只关心名字,把 IP 交给系统。
域名的层级结构
域名从右向左,是"越大越靠右"的树形结构:
- 根 (Root)整棵树的起点,全球共 13 组根服务器
- 顶级域 TLD如
.com/.cn/.org/.io - 二级域你注册来用的名字,如
baidu - 子域名你可以自定义的前缀,如
www、mail
一次解析 · 递归+迭代
浏览器先查缓存
浏览器 → 操作系统 → hosts 文件;若命中就直接用。
问本地 DNS(递归解析器)
通常是运营商或公共 DNS(如 8.8.8.8、223.5.5.5)。
本地 DNS 逐级问询
问根 → 问 .com → 问 baidu.com 的权威 DNS。
拿到 IP 返回给你
本地 DNS 记住结果(缓存 TTL 秒),下次直接答。
常见 DNS 记录类型
| 记录 | 含义 | 示例 |
|---|---|---|
A | 域名 → IPv4 | baidu.com → 110.242.68.66 |
AAAA | 域名 → IPv6 | google.com → 2404:6800::200e |
CNAME | 域名 → 另一个域名(别名) | www.a.com → a.com |
MX | 邮件服务器地址 | 企业邮箱配置 |
TXT | 任意文本,用于校验、SPF、DKIM | 域名归属证明 |
NS | 该域由哪些 DNS 服务器管辖 | 切换 DNS 服务商 |
DNS 就像"114 电话查号台":你只说"我要找北京大学",查号台一层一层帮你查到具体号码——只不过这一切在 20 毫秒内完成,且每天在全球发生数万亿次。
TCP 三次握手与四次挥手
你打电话给朋友,接通后的对话是不是这样:
你:"喂?能听到吗?"(我发送 OK 吗?)
朋友:"能听到,我说话你也能听到吗?"(你发送 OK,我也发送试试)
你:"能。"(你也发送 OK,可以正式聊了)
——这就是"三次握手"。你会发现少一次都不行:如果朋友没说第二句,你不知道他能不能听到你;如果你没说第三句,朋友也不确定他讲的话你能不能听到。
TCP 建立一次连接,需要三个来回;关闭连接,需要四个。这是网络课程最经典的"必背题",理解它能一举打通传输层。
三次握手 · 建立连接
为什么是 三次而不是两次?因为要让双方都确认对方能收、能发。少一次,服务器就无法确认自己发的包客户端能收到。
四次挥手 · 断开连接
之所以要四次,是因为 TCP 是全双工——每一方"我说完了"要单独确认。中间那"两次"看似分开,其实是服务器"我收到你要关"与"我这边也关了"两条独立信号。
主动关闭方在 ④ 之后会进入 TIME_WAIT 状态等待 2×MSL(大约 60 秒),确保最后那个 ACK 真的送达。你如果做服务端开发遇到"端口占用"报错,多半就是它。
子网与 CIDR · 把 IP 划成小院子
假设有个新小区叫"阳光家园",里面有 1000 户人家。你会怎么编号?
· 简单粗暴每户一个从 1 到 1000 的编号,找起来累死;
· 更聪明的做法:先分"1 号楼、2 号楼……",每栋楼再分"101、102、201……"。
这样地址就有层级了。找 "3 号楼 502 室" 就非常快。
IP 地址世界里也是这么划分的:把庞大的 IP 空间切成一个个"子网"(一栋楼),每个子网里有若干"主机号"(房间号)。/24、/16 这些数字,就是告诉你"这一片是一栋多大的楼"。
192.168.1.0/24 这种写法是什么意思一个 IP 地址实际上分成两半:网络号(哪个院子)+ 主机号(院子里的第几户)。子网掩码(Subnet Mask)就是那条"分割线"。
CIDR 记法
今天最常用的是 CIDR(Classless Inter-Domain Routing)写法,把掩码写成斜杠加数字:
- 192.168.1.0/24前 24 位是网络号,后 8 位是主机号 → 254 台可用主机
- 10.0.0.0/16前 16 位是网络号 → 65,534 台可用主机(大型公司内网)
- 172.16.0.0/12前 12 位固定 → 约 100 万台可用主机
- /32只有一台主机(常用于路由规则)
三段私有 IP 段(家用/公司内网专用)
| 网段 | 范围 | 典型用途 |
|---|---|---|
10.0.0.0/8 | 10.0.0.0 – 10.255.255.255 | 大型企业内网 |
172.16.0.0/12 | 172.16.0.0 – 172.31.255.255 | 中型企业内网、Docker 默认 |
192.168.0.0/16 | 192.168.0.0 – 192.168.255.255 | 家用路由器、小型办公 |
把 IP 想象成"小区门牌号":192.168.1.0/24 是"1 号院共 254 户";/16 就是把小区扩到 6 万多户。子网掩码就是那道"哪几位算院子、哪几位算门牌"的隔离墙。
NAT 与端口转发 · 一屋多户如何上网
一家酒店有 200 间房,但对外只公布一个总机号 010-12345678。
你在酒店 1503 房间想打电话给朋友——朋友回电时怎么找到你?答:酒店前台记住了"这个外线来电对应 1503 房",帮你转接。
家里的路由器就是这个"酒店前台":你家里有几十个设备(手机、电脑、电视、扫地机器人……),但对外只有一个公网 IP。路由器帮你在内部和外部之间"转接"。
你家里明明有十几个设备联网,运营商却只分给你一个公网 IP——它们是怎么共用的?答案是 NAT(Network Address Translation,网络地址转换)。
NAT 做了什么
你发出请求
手机 192.168.1.10:53211 → 想访问 baidu.com:443
路由器改写"发件人"
把源地址改成路由器的公网 IP 1.2.3.4:60001,并在自己的映射表里记住"这条 60001 对应内网 192.168.1.10:53211"。
百度回复
回复送到 1.2.3.4:60001。路由器查表 → 发回给内网原来那台设备。
端口转发 · 让外网访问家里的机器
反向操作:你有一台家庭服务器想让外部访问?在路由器上做端口映射:
NAT 是 IPv4 地址不够用的"缓兵之计":它拯救了整个互联网,也破坏了原本"每台设备可直连"的对等网络。这也是 IPv6 想彻底解决的问题。
网络安全 · 加密、认证与常见威胁
你要给朋友寄一封信,谈的是私密的事。你担心三件事:
① 路上有没有人偷偷拆开看?(机密性)
② 信到手了,会不会被人偷偷改过内容?(完整性)
③ 邮筒会不会突然罢工,信永远寄不到?(可用性)
网络安全操心的就是这三件事——业内简称 CIA。加密、签名、防火墙……都是围绕这三个目标展开。
网络安全的三大目标可以浓缩成 CIA——机密性(Confidentiality)、完整性(Integrity)、可用性(Availability)。不能被偷看、不能被篡改、随时可访问。
加密的两种基本套路
Symmetric
加密解密用同一把钥匙。快,但麻烦在于"钥匙怎么安全地交给对方"。代表:AES。
Asymmetric
一把公钥公开、一把私钥保密。公钥加密的东西只有私钥能解。代表:RSA、ECC。
Hash
把任意数据变成固定长度指纹(不可逆)。用于校验完整性、存密码。代表:SHA-256。
Signature
用私钥对数据摘要签名,对方用公钥验证——证明"这确实是我发的且没被改"。
HTTPS = HTTP + TLS
你在地址栏看到的小锁,背后是 TLS(Transport Layer Security):客户端和服务器先用非对称加密协商出一把临时对称密钥,之后所有内容都用对称密钥加密传输——既安全又快。
常见威胁一览
| 攻击 | 手法 | 典型防御 |
|---|---|---|
| 中间人 (MITM) | 在你和服务器之间偷偷插一脚 | HTTPS + 证书验证 |
| 钓鱼 (Phishing) | 伪装成正规网站骗你输密码 | 看清域名、启用 MFA |
| DDoS | 海量流量把服务器打瘫 | CDN、WAF、流量清洗 |
| SQL 注入 | 在输入框里塞恶意 SQL | 参数化查询、ORM |
| XSS | 在网页里注入恶意脚本 | 输入转义、CSP |
| 暴力破解 | 穷举密码 | 强密码、频次限制、锁定 |
1. 密码不复用,用密码管理器。
2. 尽量开启二步验证(MFA)。
3. 公共 WiFi 上做敏感操作前,先确认是 HTTPS。
无线与移动网络 · WiFi、蓝牙与 5G
想象你家里同时开着:一台收音机(长距、慢),一台无绳电话(中距),一副耳机(短距)——它们都是"无线",但用了不同的频段、不同的规矩,互不打扰。
网络世界也是这样:
· WiFi:家里几十米范围,速度快;
· 蓝牙:几米,专门给耳机、鼠标;
· 4G / 5G:几公里,靠基站;
· NFC:几厘米,用于刷公交、支付。
它们都是"无线",但分工不同、用途不同。
把线拔掉、让数据通过电磁波传输,就是无线网络。它们靠频段、信道、协议三件事区分。
WiFi 各代速览
| 标准 | 俗名 | 频段 | 理论速率 |
|---|---|---|---|
| 802.11n | WiFi 4 | 2.4 / 5 GHz | 600 Mbps |
| 802.11ac | WiFi 5 | 5 GHz | 3.5 Gbps |
| 802.11ax | WiFi 6 / 6E | 2.4 / 5 / 6 GHz | 9.6 Gbps |
| 802.11be | WiFi 7 | 2.4 / 5 / 6 GHz | 46 Gbps |
2.4GHz 像低频广播——传得远、穿墙好,但速度慢、干扰多;
5GHz 像高频广播——速度快、干扰少,但传不远、穿墙差。所以现代路由器"双频合一",让手机自动选。
蓝牙、NFC、Zigbee
- 蓝牙 (BT)短距、点对点,用于耳机、鼠标、传文件
- BLE蓝牙低功耗,用于手环、门锁、iBeacon
- NFC数厘米,用于支付、门禁、公交卡
- Zigbee低功耗自组网,智能家居设备常用
蜂窝网络 2G → 5G
5G 的意义不只是"更快",还有 低时延(1ms 级)和 海量连接(每平方公里 100 万设备)——这是自动驾驶、工业互联网、AR/VR 的地基。
云与边缘 · CDN、云网络与容器
星巴克咖啡豆的原产地在南美。如果全国人喝一杯咖啡,都要去南美的仓库取豆,肯定慢死。
所以星巴克在每个城市开分店,甚至每条街都开一家——豆子提前运到分店,你要喝就近取。这是"离用户近"。
网络里也有类似的东西:CDN(内容分发网络)。腾讯视频、B 站的内容不会每次都从深圳源头服务器拉,而是提前放在离你最近的城市机房里,你打开就几乎瞬间加载。
你今天访问的 xuehai-wuya.pages.dev 也是——Cloudflare 在全球有 300+ 个"分店",你打开的是离你最近那一家。
过去的网络世界是"我搭机房、我买带宽、我配路由器";今天大部分服务都跑在云上,用户和服务之间还夹着边缘节点。
CDN · 内容分发网络
CDN 是"把内容提前搬到离你最近的机房"的技术。你在深圳打开某网站,其实是访问了深圳的缓存节点,而不是远在美国的源站。
请求先命中 CDN 边缘节点
DNS 会根据你的位置返回最近节点的 IP。
节点若有缓存 → 直接返回
毫秒级响应,源站毫无负担。
没有缓存 → 回源
从源站拉一次,缓存下来,之后同一区域的人都受益。
云网络三件套
虚拟私有云
你在云上"圈出的一块独立网络",就像自己的机房。
负载均衡
一个公网 IP 分发到多台后端服务器,避免单点。
安全组
云上的防火墙规则,决定谁能连你的机器。
容器网络
Docker、Kubernetes 让每个应用装进一个"集装箱",容器之间通过虚拟网络互通。Service、Ingress、Pod IP 是你以后会反复看到的词——但本质仍是本文前面讲过的 IP、端口、DNS。
无论多么复杂的云原生架构,拆开都是 IP + 端口 + 协议 + 路由 + DNS。只是数量更多、层级更深,运行在别人的机房里而已。
排错工具箱 · 五个救急命令
家里水管漏水,你不会直接砸墙——会先一段段排查:
① 总闸阀有水吗? → 没水是自来水公司的事;
② 家里主管道通吗? → 不通是入户线的事;
③ 具体哪个水龙头出问题? → 找到罪魁祸首。
网络出问题——"网页打不开"——也是这么一层一层排查的。本章给你五个"网络水管工工具":ping、traceroute、nslookup、curl、netstat。
当"上不了网"时,怎样一步步定位?以下五个命令是终端里的"急救包",Windows 和 macOS/Linux 略有差异,写法我一并给你:
① ping · 测通不通
发送 ICMP 包,看对方能不能回。是最基础的"我能到吗?"
② traceroute · 走了哪条路
逐跳追踪数据包路径,看在哪一站出问题。
③ nslookup / dig · 域名解析
怀疑域名解析出错时用它。
④ curl · 手动发一次 HTTP 请求
不打开浏览器就能看服务器返回。
⑤ netstat / ss · 谁占了端口
本机端口被谁占用、有哪些连接开着。
① ping 网关能通吗?→ 不能就是本地网络问题。
② ping 8.8.8.8 能通吗?→ 不能就是运营商问题。
③ ping baidu.com 能通吗?→ 不能但 ② 通,就是 DNS 问题。
未完待续 · 更多板块
下方为预留占位,后续章节将按同样的排版规则加入。
IPv6 与下一代互联网
为何 IPv4 不够用、IPv6 长什么样、如何过渡。
网络性能优化
为什么慢?TTFB、RTT、丢包与拥塞控制。
网络编程入门
Socket、Web 请求、简单服务器代码实战。
Git 篇
迎宾章 · 从你今天做的事说起
在讲抽象概念之前,我先用你今天亲手做的那件事——把"学海无涯"网站放到互联网上——一步步告诉你:Git 是什么、GitHub 是什么、它们到底做了什么。
你今天到底做了什么
今天下午,你完成了这样一套流程:
你的电脑上写好了一份网页
它就是那个 xuehai-wuya 文件夹,里面有 index.html、字体、图片脚本等。此时它只在你的硬盘上,别人看不到。
你安装了 Git,并用它"记录"了整个文件夹
Git 是一个装在你电脑上的工具。它给你的文件夹打了一个"档案编号",把整个文件夹的内容拍了一张"完整快照"存起来。这一步叫 提交(commit)。
你在 GitHub 上开了一个"仓库"账户
GitHub 是互联网上的一个网站,任何人可以在上面免费开一个"文件夹储物柜",叫做仓库(Repository)。你开的那个柜子叫 WANG-star-alt/xuehai-wuya。
你把本地的档案推(push)到了 GitHub
Git 就像一个快递员,把你电脑上的这个文件夹的"完整快照"以及所有历史记录,一次性搬上互联网 GitHub 的那个储物柜。
Cloudflare 从 GitHub 那把柜子里"取件",摆到网上
Cloudflare Pages 是另一个网站,它盯着你在 GitHub 的那个仓库。你一 push,它立刻把新内容拿出来,架设成一个真正能访问的网址:xuehai-wuya.pages.dev。
把你的电脑文件夹想象成你家书房里的一本手稿:
· Git = 一个私人抄写员,替你把手稿的每一次改动都拍照存档;
· GitHub = 城市中央图书馆,愿意免费借你一个"专属书架"存这本书的所有版本;
· 你 push = 抄写员把最新的稿子送去图书馆书架;
· Cloudflare = 一个印刷厂,它看到图书馆有新稿子就自动开印,做成免费的报纸贴到互联网大街上。
三个名字,三种角色
装在你电脑上的工具
它是一个软件,负责"记录、比较、回退"你的文件历史。离线也能用,跟互联网无关。
互联网上的网站
它是一个"给 Git 用的云盘 + 社交平台",帮你把本地仓库放到网上,也让其他人能看到、协作。
仓库
就是"一个项目"。本地那份叫本地仓库,GitHub 上那份叫远程仓库。两者内容会通过 push / pull 保持同步。
常见的疑问,先在这里回答
- Git 要联网吗?不用。本机做记录、看历史都不需要网。只有和 GitHub 传输时才要。
- GitHub 一定要用吗?不是。Git 单独就能用;GitHub 只是最流行的"Git 云盘"。类似的还有 GitLab、Gitee。
- 我上传的东西是啥?是你项目文件夹 + 每一次提交的完整历史。不是压缩包,是可查询的历史全集。
- 为什么叫 push?因为是"推"——把本地的东西推到远端。反过来把远端拉回本地叫
pull。 - 别人看得到吗?仓库是 Public 就任何人可看;Private 就只有你和你邀请的人可看。你的是 Public。
1. Git 是软件还是网站?(软件)
2. GitHub 是软件还是网站?(网站)
3. 你今天的网页托管在哪台服务器上?(Cloudflare 的边缘节点,源码存在 GitHub)
4. 如果 GitHub 挂了,你本地代码会丢吗?(不会,本地那份完整独立)
序章 · Git 是什么
Git 是一部时间机器,也是一份分身术——它记住你每一次修改,让你可以随时回到过去;也让你同时活在多条时间线里,做完实验再决定要不要保留。
一句话理解
Git 是一个分布式版本控制系统:它把你的整个项目历史存在一个 .git 文件夹里,让你可以查看、比较、回退任何一次改动。它由 Linux 之父 Linus Torvalds 于 2005 年为管理 Linux 内核而写。
如果说"网盘"是保存最新一份文件,Git 就是保存所有版本的私人史官——从你项目诞生那一秒起的每一次改动都被记录,且可以用一条命令回到任意时刻。
为什么要学 Git
不再"final_v3_真的最终版"
每一次改动自动有版本号,随时可回退,不再靠文件名区分。
多设备无缝同步
推到 GitHub,家里公司随时接着写。
多人协作不打架
用分支把每个人的改动隔离,最后再合并。
时光机自救
"糟糕,代码删多了" —— 一条命令回到 30 分钟前。
Git 的三条"底层信条"
不是要背,是要理解——理解了这三条,很多命令就顺理成章:
- ① 快照式Git 不是记"这次改了哪几行",而是每次都拍一张完整的文件夹快照。这样任何时刻都能立刻切到任何一版。
- ② 分布式每台电脑上都有完整历史——GitHub 挂了、别人硬盘坏了,你这里都还在。没有"中央服务器"这个单点。
- ③ 只增不减Git 几乎不会真删东西。删掉的东西通常还在硬盘里 30 天,用
git reflog大概率能捞回。
Git 与 GitHub · 二者到底什么关系
很多人第一次听到 Git 和 GitHub,会以为它们是同一样东西。其实完全不是。它们的关系类似"Word 之于 OneDrive"、"微信之于腾讯"——一个是工具,一个是承载工具产物的平台。
先看一张对照表
| 维度 | Git | GitHub |
|---|---|---|
| 是什么 | 一个软件(命令行工具) | 一个网站(在线服务) |
| 装在哪里 | 你自己的电脑 | 别人家的服务器(微软的机房) |
| 需要联网吗 | 不需要 | 需要(是个网站嘛) |
| 谁做的 | Linus Torvalds,2005 年 | 三个美国人 2008 年创立,2018 年被微软收购 |
| 要不要钱 | 免费开源 | 基础版免费,企业版收费 |
| 能替换成什么 | Git 几乎没替代品 | 可换 GitLab、Gitee、Bitbucket 等 |
| 做什么用 | 记录、比较、回退文件版本 | 把你的 Git 仓库放到网上、协作、展示 |
| 核心动词 | commit / branch / merge | Pull Request / Issue / Star |
一句话说清关系
Git 是"照相机",GitHub 是"网络相册"。
没有相册,你依然能拍照;但把照片放到相册里,别人才能看到、评论、点赞。
少了照相机,相册也无照可放。二者互相成就,但确实是两件事。
为什么大家都用 GitHub
免费的云备份
你本地硬盘坏了、电脑丢了,GitHub 上那份完整还在。
多设备同步
家里改一半、去公司 git pull 就能接着写。
开源社交
全球开发者的"聚集地",很多顶级项目都在这里协作。
免费部署
Cloudflare / Vercel / Netlify 都能直连 GitHub 自动部署——就像你今天做的一样。
三个容易搞混的名字
- Git你电脑上的软件。你今天
winget install装的就是它。 - GitHub一个具体的网站:
github.com。你今天注册的账号WANG-star-alt就在这。 - Git 仓库 / GitHub 仓库同一个东西的两个位置——"本地仓库"在你电脑里、"远程仓库"在 GitHub 上。用
push/pull同步。
你今天做的事,用这两个概念重述一次
Git 和 GitHub 的关系类似"文件 → 网盘":Git 管的是版本,GitHub 管的是同步与共享。理解了这一点,剩下所有 Git 相关的概念都能对号入座。
概念地图 · 仓库、工作区、暂存区
入门 Git 最重要的一步:建立"三个区"的心智模型。所有 Git 命令都是在这三个区之间搬运东西。
三个区 · The Three Trees
- 工作区Working Directory —— 你当前看得见、能编辑的文件夹
- 暂存区Staging Area / Index —— 一个"待打包"的清单,决定这次提交带走哪些改动
- 仓库Repository ——
.git文件夹,保存所有历史版本
寄快递:工作区是你桌面上散落的东西;暂存区是你挑好、放进纸箱的东西;仓库是快递公司的档案库,收下后就永久登记。git add = 把东西放进纸箱;git commit = 封箱送走。
三条常用命令的定位
| 命令 | 做什么 | 影响哪个区 |
|---|---|---|
git add 文件 | 把改动加入暂存区 | 工作区 → 暂存区 |
git commit -m "说明" | 把暂存区打包为一次提交 | 暂存区 → 仓库 |
git checkout 文件 | 放弃工作区改动,回到上一版 | 仓库 → 工作区 |
git reset 文件 | 把改动从暂存区退回工作区 | 暂存区 → 工作区 |
初次上手 · 从零建立一个仓库
你已经用 Git 部署过 xuehai-wuya,我们复盘一下每一步的意义。
四步建立一个 Git 项目
初始化仓库
在项目文件夹里执行 git init——Git 会新建一个隐藏的 .git 目录,作为整个仓库的大脑。
配置身份
git config user.name "你的名字"、git config user.email "你的邮箱"——决定这次提交的作者是谁。
加入所有文件
git add .——把当前目录里的所有变化放入暂存区。
提交
git commit -m "初次提交"——把暂存区打包成一次带说明的历史记录。
完整命令示例
项目里总有一些"不想被跟踪"的文件(临时缓存、密码、大二进制)。在根目录建一个 .gitignore 文件,写上不想上传的内容,Git 就会自动忽略:
日常命令 · 十条最常用
日常 95% 的 Git 使用,就是这十条命令的组合。背下它们,你就能自如工作。
| 命令 | 作用 | 使用频率 |
|---|---|---|
git status | 看当前哪些文件改动了、哪些进了暂存区 | ★★★★★ |
git add . | 把所有改动加入暂存区 | ★★★★★ |
git commit -m "说明" | 提交暂存区 | ★★★★★ |
git push | 把提交推到远程(GitHub) | ★★★★★ |
git pull | 从远程拉取别人的更新 | ★★★★☆ |
git log | 看历史记录 | ★★★★☆ |
git diff | 看具体改动了什么 | ★★★☆☆ |
git branch | 查看/新建分支 | ★★★★☆ |
git checkout / switch | 切换分支 | ★★★★☆ |
git merge | 合并另一条分支 | ★★★☆☆ |
典型的一天
一条好的提交信息应该一句话说清"这次改了什么、为什么"。业界流行的规范叫 Conventional Commits:feat: 新增登录功能、fix: 修复分页错误、docs: 更新 README。
分支 · 平行世界的开关
分支(Branch)是 Git 最重要的特性:它让你可以在不影响主线的前提下尝试任何改动。做完满意就合并,不满意就抛弃。
分支是什么
分支不是"复制一份代码",而是一个指向某次提交的可移动指针。默认分支叫 main(旧版叫 master)。
分支常用命令
- git branch列出所有本地分支,当前所在分支前面有 *
- git branch feat-login新建一个叫 feat-login 的分支
- git switch feat-login切换到该分支(新版命令)
- git switch -c feat-login一步到位:新建 + 切换
- git branch -d feat-login删除该分支(已合并的)
- git branch -D feat-login强制删除(未合并也删)
分支的典型工作流
从 main 开一个新分支
git switch -c feat-search,开始搞"搜索功能"。
在分支上改代码、提交
正常 add / commit,改坏也不影响 main。
切回 main
git switch main,此时你看到的代码回到未加搜索功能的状态。
合并 or 抛弃
满意就 git merge feat-search;不满意就 git branch -D feat-search。
分支像写小说时的多个存档:主线剧情一直存着,你另开一个 slot 尝试"如果主角选另一条路会怎样"。写不下去就删掉存档,写好了就把它并回主线。
合并与冲突 · 两条河汇入一条
merge 与 rebase
合并式
把两条分支的提交都保留下来,多一个"合并提交"节点。历史真实但可能显得杂乱。
变基式
把你的提交"复制粘贴"到目标分支尾部,历史看起来是一条直线。整洁但改写了历史。
刚学 Git 时只用 merge 就够了,安全、直观。rebase 是熟练之后再学的进阶技巧。
冲突长什么样
当两条分支改了同一个文件的同一处,Git 无法自动判断该用谁的,就会产生冲突。文件里会出现这样的标记:
三步解冲突
打开冲突文件
手动决定保留哪一边(或两边都要),删掉那些 <<</===/>>> 标记。
标记冲突已解决
git add 文件
完成合并
git commit(无需 -m,Git 会自动写一条合并说明)
远程 · 与 GitHub 对话
本地仓库和远程仓库(GitHub 上那份)通过"远程地址"关联。默认远程别名叫 origin。
常用远程命令
| 命令 | 作用 |
|---|---|
git remote -v | 看已配置的远程地址 |
git remote add origin URL | 添加一个叫 origin 的远程 |
git remote remove origin | 移除远程 |
git push -u origin main | 首次推送并绑定跟踪关系(-u 只需要一次) |
git push | 之后直接推 |
git pull | 拉取并合并远程更新 |
git fetch | 只拉取,不自动合并 |
git clone URL | 克隆一个远程仓库到本地 |
HTTPS vs SSH
- HTTPS形如
https://github.com/xxx/yyy.git,每次推送要密码/Token - SSH形如
git@github.com:xxx/yyy.git,配好密钥后一劳永逸
从 2021 年起 GitHub 不再支持密码登录,必须用 Personal Access Token(PAT)。在 Settings → Developer settings → Personal access tokens 里生成,第一次 push 弹窗时把它当密码填即可。Windows 会用凭据管理器帮你记住。
时光机 · 回退、撤销与拯救
Git 最迷人的地方,是几乎所有操作都可撤销。你以为删没了?只要提交过一次,就能捞回来。
不同场景对应不同"撤销"
| 情况 | 命令 |
|---|---|
| 改错了,还没 add,想还原 | git checkout -- 文件 或 git restore 文件 |
| 已经 add 了,想退回工作区 | git reset HEAD 文件 或 git restore --staged 文件 |
| 已经 commit 了,想改上一条 commit 说明 | git commit --amend -m "新说明" |
| 想撤销最近一次 commit(保留改动) | git reset --soft HEAD~1 |
| 想彻底丢掉最近一次 commit | git reset --hard HEAD~1(危险) |
| 想不改历史、追加一条"反悔"commit | git revert 提交号 |
如果你误 reset --hard 把提交搞没了 —— 别慌!git reflog 会列出你所有"HEAD 曾经指向过的位置",找到那个提交号,git reset --hard 提交号 就能救回。Git 通常要 30 天后才真正删除。
协作流 · PR、Fork 与团队工作流
Pull Request(PR)· 请求合并
在 GitHub 上,你不能直接把改动推到别人的仓库。标准动作是:
Fork
在别人的仓库右上角点 Fork,得到一个属于你自己的副本。
Clone 你的 Fork
git clone https://github.com/你/xxx.git,本地开始改。
开分支 + 改 + 提交 + 推
把改动推到你自己的 Fork。
发起 Pull Request
在原仓库页面点 "New pull request",说明你改了什么。等原作者审核合并。
三种主流团队工作流
Git Flow
有 master / develop / feature / release / hotfix 多种分支。经典但重。
GitHub Flow
只有 main + feature 分支。GitHub 官方推荐,轻量高效。
Trunk Based
大家都往 main 提交,短命分支即开即合。Google、Facebook 在用。
小团队/个人项目 → GitHub Flow 就够了;大型持续发布产品 → Git Flow;追求速度的顶尖工程团队 → Trunk Based。
锦囊 · 高频问答与私藏技巧
十个高频问答
- Q · 忘了 -m 写说明?默认会弹出编辑器(vim/nano),按
i编辑,写完Esc→:wq保存退出 - Q · 想少打 git status?配置别名:
git config --global alias.s status,之后git s即可 - Q · 提交历史像坨面条?
git log --oneline --graph --all,一览无余 - Q · 改动只想推一部分?
git add -p逐块选择要加什么 - Q · 临时切走但不想 commit?
git stash暂存,回来后git stash pop还原 - Q · 想看某文件的历史?
git log -p 文件名 - Q · 谁写的这一行代码?
git blame 文件 - Q · 想同步别人最新更新?
git pull --rebase,比默认 pull 历史更整洁 - Q · 上传了敏感信息怎么办?立即改密码 + 用
git filter-repo清历史 + 强推。血泪教训是永远不要直接推.env - Q · GUI 工具推荐?VS Code 自带 Source Control 面板;进阶用 GitKraken、SourceTree、Fork
三条私藏技巧
写有意义的 commit 信息。一年后你翻历史,能不能一眼看懂当时改了什么,全看当时那句 -m。
小步提交,频繁 push。一次改 1000 行难以复审也难以回退;一次改 100 行,回退极其精准。
先建 .gitignore 再 git add .。否则一旦把 node_modules 之类的大目录传上去,之后想清很麻烦。
Git 的世界看似浩瀚,其实日常 90% 只用五个动作:status → add → commit → push → pull。剩下的都是"救命"和"进阶",遇到时再查即可。
未完待续 · 更多板块
Git 内部原理
对象、SHA-1、pack 文件、HEAD 指针背后的世界。
GitHub Actions · CI/CD
推送时自动测试、自动部署,让代码自己会跑起来。
AI 篇
迎宾章 · 从你每天用的那个"AI"说起
孩子,坐下。你已经每天都在用 AI 了——只是没意识到。这一章我不讲公式,先带你看看 AI 已经悄悄住进了你生活的哪些角落,再一步步告诉你:这一切背后到底是怎么运转的。
早上闹钟响,你打开手机——从这一刻起,AI 就开始工作了:
相册自动把去年三亚的照片挑出来做成回忆视频;输入法还没等你打完就猜出下一个词;抖音第一条视频恰好是你想看的;美团推荐的午餐正是你上周想吃的;DeepSeek 或 ChatGPT 帮你写了一封邮件;高德告诉你绕开哪条路会少堵 8 分钟。
本篇要回答的十件事
- Q1AI 到底是不是"活的"?它有意识吗?
- Q2机器学习、深度学习、AI,是同一样东西吗?
- Q3大模型(LLM)为什么这么厉害,它是怎么"想问题"的?
- Q4Transformer 是什么?ChatGPT 里的 "T" 指的就是它吗?
- Q5为什么 AI 会一本正经地胡说八道(幻觉)?
- Q6怎么"问"AI,才能得到你想要的答案?
- Q7AI Agent、RAG、微调、蒸馏……这些词到底啥意思?
- Q8图片、视频、语音,AI 是怎么"生成"出来的?
- Q9AI 会取代我的工作吗?我该怎么办?
- Q10怎么判断哪些是 AI 的真本事,哪些是营销吹嘘?
把 AI 想象成一个刚学会说话、但读过整座图书馆的孩子:
· 它知道得非常多——因为读得多;
· 它说话很流畅——因为反复练过;
· 但它没有"经验"和"常识"——所以偶尔会一本正经地胡说;
· 它没有情感,只是在猜下一个最合适的词——这个"猜",就是本篇要拆给你看的核心秘密。
1. 用一句话向长辈解释什么是 AI;
2. 分清 AI、机器学习、深度学习、大模型;
3. 知道 ChatGPT / DeepSeek 每次回答背后发生了什么;
4. 会写"能得到好答案"的提示词;
5. 判断哪些 AI 说法是靠谱的、哪些是营销话术。
序章 · AI 到底是什么
AI(Artificial Intelligence,人工智能)不是一个单一的东西,而是"让机器做那些原本需要人类智能才能做的事"的一整套技术与思路。它不神秘——本质上,它是一门"教机器识别规律"的学问。
一句话理解
如果一台机器能识别(认出这是猫)、能预测(明天大概率下雨)、能决策(这条路更快)、能生成(写一首诗、画一幅画)——它就在做 AI 的事。
普通程序像菜谱——你写死每一步,它照做。
AI 像厨师学徒——你给它一千道菜的示范,它自己总结出"糖醋要先炒糖色"这样的规律,之后遇到新食材也能做出合理的菜。
AI 的四种典型能力
感知 · Perceive
把图像、声音、文字变成机器能懂的东西。
例:人脸解锁、语音转文字、扫码识别。
理解 · Understand
从内容里"读出意思"。
例:翻译、情感分析、搜索引擎判断你到底想找什么。
决策 · Decide
在多种选择里挑一个更好的。
例:推荐系统、自动驾驶、下棋 AI。
生成 · Generate
造出新的内容。
例:ChatGPT 写文章、Midjourney 画图、Sora 生成视频。
"弱 AI"与"强 AI"
你要分清两个层次,媒体经常混着讲:
| 类型 | 英文 | 能做的事 | 今天到哪一步 |
|---|---|---|---|
| 弱 AI / 专用 AI | Narrow AI (ANI) | 只在某个特定领域超过人 | 已经实现:下棋、写代码、看 CT 片 |
| 强 AI / 通用 AI | General AI (AGI) | 像人一样能干任何智力活 | 尚未实现,但今天的大模型让它看起来近了很多 |
| 超级 AI | Super AI (ASI) | 在所有领域全面超越人类 | 仍是科幻,不是工程 |
你今天用的 ChatGPT、DeepSeek、通义千问,虽然聊天很像人,但严格来说仍然是"弱 AI"——它们在"生成语言"这件事上极强,但没有身体、没有欲望、没有目标,也不"懂"自己在说什么。
AI 不会做的事(先记住这一点)
- 没有意识它不"知道"自己是 AI,也不"想"任何事。
- 没有真实理解它擅长模仿"像人的回答",但不像人那样体验世界。
- 没有长时记忆你今天和它说的话,明天它默认不记得(除非产品给它加了记忆功能)。
- 不会自我反思它可以"看起来在反思",那是训练数据里学到的反思腔调,不是真的在反思。
三个圈 · AI、机器学习、深度学习
方式一(AI 的最早思路):你把菜谱一条条抄下来给他——"糖 5g,火开大 3 分钟"。他严格照做,能做出这一道,但换个食材就不会。
方式二(机器学习):你不给菜谱,只让他尝一千道菜,告诉他"这是酸的、这是咸的、这是好吃的"。他自己总结出规律,遇到新菜也能做出合理判断。
方式三(深度学习):还是让他尝,但这次他脑子里有一整套"味觉神经网络"——先感受咸淡、再判断浓淡、再感受层次,一层套一层。能力最强,但也需要更多的菜(数据)和更多的时间(算力)。
一句话理清三者关系
它们不是并列的三样东西,而是大圈套小圈:深度学习 ⊂ 机器学习 ⊂ 人工智能。
| 名字 | 英文缩写 | 它是什么 | 典型例子 |
|---|---|---|---|
| 人工智能 | AI | 最大的圈。凡是"让机器有点智能"的都算,包括写死的规则 | 专家系统、下棋程序、扫地机器人 |
| 机器学习 | ML | AI 的一个流派:不写规则,让机器从数据里自己找规律 | 垃圾邮件识别、房价预测、信用评分 |
| 深度学习 | DL | ML 的一个分支:用"深层神经网络"来学 | 人脸识别、语音识别、大语言模型 |
| 生成式 AI | GenAI | DL 的一个方向:让 AI"造"新东西 | ChatGPT、Midjourney、Sora |
| 大语言模型 | LLM | GenAI 的当红品种:专门处理"语言" | GPT-4、Claude、DeepSeek |
AI 是"运动"这个大概念;ML 是"球类运动";DL 是"篮球";LLM 是"NBA 里的中锋"。
越往里越具体、能力越强,但也越挑食(要数据、要算力)。
为什么现在大家都在说"深度学习"
- 数据够多了互联网 30 年积累了海量文字、图像、视频,训练素材空前充足。
- 算力够便宜了GPU(显卡)让原本要几年才能训练完的模型,几周就能出结果。
- 算法开了窍2017 年 Transformer 出现,让模型能真正"读长句子",是这一波革命的开端。
- 效果一骑绝尘深度学习在图像、语言、语音上的表现,把传统方法远远甩开。
看到"AI",你要在心里默默替换成"机器学习",然后再问一句"是深度学习吗?"——今天几乎所有让人惊艳的 AI,答案都是"是"。
简史 · 六十年三起三落
AI 不是一夜爆红的。它已经走过 70 年,中间经历过两次几乎被彻底放弃的"寒冬"。了解这段历史,你就能看懂——为什么这一次它真的不一样。
时间线一览
| 年代 | 里程碑 | 发生了什么 |
|---|---|---|
| 1950 | 图灵测试 | 图灵在论文里问:机器能思考吗?提出"看不出对面是不是人"的判定法。 |
| 1956 | 达特茅斯会议 | McCarthy 等人首次提出"Artificial Intelligence"这个词。AI 正式诞生。 |
| 1958 | 感知机 | Rosenblatt 提出神经网络最早的雏形——感知机(Perceptron)。 |
| 1974–1980 | 第一次寒冬 | 能做的事太少、期望被吹得太高,政府撤资,研究陷入停滞。 |
| 1980s | 专家系统兴起 | 把领域专家的知识写成规则,医院、银行开始用。短暂繁荣。 |
| 1987–1993 | 第二次寒冬 | 专家系统维护成本太高、扩展性差。产业再次崩盘。 |
| 1997 | 深蓝 vs 卡斯帕罗夫 | IBM 深蓝击败国际象棋世界冠军。AI 首次登上大众视野。 |
| 2012 | AlexNet | 深度神经网络在图像识别比赛上大幅领先。深度学习革命开始。 |
| 2016 | AlphaGo | Google 的 AI 击败围棋世界冠军李世石。"人类最后的智力堡垒"被攻下。 |
| 2017 | Transformer | Google 论文《Attention Is All You Need》。为大模型时代埋下地基。 |
| 2022.11 | ChatGPT 发布 | 两个月一亿用户,人类第一次和 AI 自如对话。生成式 AI 时代到来。 |
| 2023–2024 | 百模大战 | GPT-4、Claude、Gemini、文心、通义、DeepSeek 等纷纷登场。 |
| 2025 | 推理模型 & 智能体 | o1/o3、DeepSeek-R1 等"会思考"的模型出现;AI Agent 开始能自己完成任务。 |
AI 的历史像四季轮回:春——诞生新想法;夏——媒体狂热、公司哄抢;秋——落地遇困难;冬——大批研究者转行。
今天我们大概率处在夏末——技术仍在爆发,但落地和商业化的秋天也已悄悄到来。
三次浪潮,三种思路
符号主义 · 1950s–1980s
信念:"智能 = 逻辑推理"。人写规则,机器执行。
代表:专家系统、Prolog 语言。
局限:世界规则写不尽,遇到新情况就傻。
统计学习 · 1990s–2010s
信念:"智能 = 从数据里找相关"。用概率和数学模型学。
代表:支持向量机(SVM)、随机森林。
局限:能学但学不深,处理不了图像那种复杂结构。
深度学习 · 2012–今天
信念:"智能 = 大量数据 + 深层网络 + 大量算力"。
代表:CNN、RNN、Transformer、大模型。
能力:从识图到生成,从聊天到写代码,无所不能——但也存在幻觉。
历史告诉你一件事:每次都有人喊"这次真的不一样"——过去两次都错了。这一次到底会不会错?没人能保证。但从技术底座(Transformer、算力、数据)看,这次的"地基"确实比前两次都厚。
机器学习 · 让机器从数据里找规律
你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。
整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切开过的新瓜是"泛化能力"。
机器学习的三大流派
| 流派 | 英文 | 你给它什么 | 它学到什么 | 典型任务 |
|---|---|---|---|---|
| 监督学习 | Supervised | 数据 + 标准答案 | 输入 → 输出的映射 | 垃圾邮件识别、房价预测、看片诊断 |
| 无监督学习 | Unsupervised | 只有数据,没有答案 | 数据里的结构、群体、异常 | 用户分群、异常检测、话题聚类 |
| 强化学习 | Reinforcement | 一个环境 + 奖励/惩罚 | 在环境里"怎么做能得高分" | 下棋 AI、机器人控制、自动驾驶 |
| 自监督学习 | Self-supervised | 只给数据,自己造答案 | 数据的深层表征 | 大语言模型的预训练(今天的主流) |
监督学习:老师每题都给标答,你对着改。
无监督学习:老师不给答案,只把一堆卷子放你面前,让你自己分类。
强化学习:老师不讲课,只在你做对时说"好"、做错时说"不好",你自己摸索。
自监督学习:老师撕掉一半试卷让你补全另一半——不需要额外标注,就能从原文本里"自问自答"地学。
机器学习是怎么"学"的(四步)
1. 准备数据
收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。
2. 选一个模型
比如线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。
3. 训练 · 让参数变对
把训练数据喂进去,让模型不断修正参数,直到预测和真实答案的差距(损失)尽可能小。
4. 评估 · 用没见过的数据考它
拿测试集打分。如果考得好,说明模型"泛化"了;如果只在训练集上好,叫做过拟合——死记硬背而已。
三个必知术语
- 特征 · Feature用来喂给模型的"输入维度"。挑西瓜时,"响声、颜色、瓜蒂"就是三个特征。
- 标签 · Label你希望模型学到的"正确答案"。西瓜切开后的"甜/不甜"就是标签。
- 过拟合 · Overfit模型在训练集上完美、遇到新数据就傻。就像有人只会做他做过的题。
机器学习的核心是"给经验,学规律,用规律"。今天再复杂的 AI(包括大模型),底子上仍然是这三个字:学·验·用。
神经网络 · 借鉴大脑的一种数学结构
神经网络(Neural Network)是"深度学习"的骨架。名字听起来像生物学,其实它就是一堆连在一起的数学函数——只是这种连法,恰好模仿了大脑神经元传递信号的方式。
想象一条饮料分拣流水线:
· 第一层工人只看瓶身颜色(是绿的、红的还是透明的);
· 第二层工人根据颜色 + 瓶盖形状再分(是可乐、雪碧还是水);
· 第三层工人根据前两层的结论决定放到哪个箱子。
每个工人都很笨,只做一件小判断;但一层套一层,整条流水线就能干出很复杂的事情。
一个"神经元"到底在做什么
把神经元想象成一个会打分的小盒子:
- 输入上一层送过来的若干数字(比如"颜色 0.8、形状 0.2、大小 0.5")
- 权重给每个输入乘一个"重要度"(这些权重就是模型要学的东西)
- 求和把加权后的输入全加起来
- 激活用一个非线性函数(如 ReLU、Sigmoid)决定"要不要传给下一层、传多少"
- 输出一个数字,送给下一层的所有神经元
神经元像一个评委:你的舞蹈、歌唱、才艺各得几分(输入);他心里对每项有不同偏好(权重);他把分数加起来(求和),然后决定是否让你晋级(激活)。
训练神经网络,就是不断调整每个评委的"偏好",直到整场比赛的评选结果最接近观众心中的答案。
为什么要"深"
只用一层神经元,模型只能学会最简单的规律(比如线性分类)。多加几层,网络就能逐层抽象——就像饮料流水线,越靠后的工人看到的信息越"高级":
底层 · 认边缘
图像 → 直线、拐角、明暗。
文字 → 单个字符或音节。
中层 · 认组件
图像 → 眼睛、鼻子、轮子。
文字 → 词、短语的意思。
高层 · 认整体
图像 → 猫、车、人脸。
文字 → 一句话说的是"抱怨"还是"表扬"。
常见的几种网络"造型"
| 名字 | 擅长 | 典型应用 |
|---|---|---|
| CNN · 卷积神经网络 | 图像 | 人脸识别、医学影像、抖音特效 |
| RNN / LSTM | 序列 | 早期语音识别、翻译(现在被 Transformer 取代大半) |
| Transformer | 长序列 · 语言 | 大语言模型(GPT、Claude、DeepSeek) |
| GAN · 生成对抗网络 | 造假图 | 换脸、老照片修复、艺术风格迁移 |
| Diffusion · 扩散模型 | 造图 / 视频 | Midjourney、Stable Diffusion、Sora |
神经网络不是真正的大脑,它没有意识、没有神经递质、没有生物学意义上的"学习"。它只是借鉴了大脑"信号在多层之间传递"的思路,然后用纯数学把它实现了。
训练三部曲 · 数据、模型、损失
训练一个 AI,说到底就三件事:拿到数据、搭好模型、让它把答案越猜越对。任何一个 AI 项目,从教一个小学生模型到训练 GPT-4,都逃不出这三部曲。
你教一个孩子打靶:
· 数据:靶子和一堆箭;
· 模型:孩子的手臂动作(瞄准、力度、呼吸);
· 损失:箭偏了靶心多远——每偏一次,你告诉他"再往左一点、再压低一点"。
他不断根据"损失"调整动作。射多了,动作定型,命中率上升。这就是训练。
第一部曲 · 数据
数据是 AI 的"食物"。有句业内名言:Garbage in, Garbage out(喂垃圾进去,只能吐垃圾出来)。数据决定了模型能力的天花板。
- 数量GPT-4 大约用了 13 万亿个 token 训练,相当于人类所有主要网页文本。
- 质量100 万条干净数据 > 1 亿条有噪音的数据。
- 多样性只喂新闻,模型不会写代码;只喂英文,模型的中文就差。
- 时效性2023 年训练的模型不知道 2024 年的事——除非之后被"更新"。
第二部曲 · 模型
模型是一个"带参数的函数"。你可以粗暴理解为:y = f(x; 参数)——输入 x(问题),经过一大堆参数运算,输出 y(答案)。
"多大的模型",通常说的就是参数量:
| 规模 | 参数量 | 大约需要什么 | 代表 |
|---|---|---|---|
| 小 | 几亿 | 一台笔记本能跑 | BERT-base、Qwen-0.5B |
| 中 | 几十亿 – 几百亿 | 单张 A100 显卡 | Llama-7B/13B |
| 大 | 千亿 | 数千张 GPU 集群 | GPT-4、Claude、DeepSeek-V3 |
| 超大 | 万亿 (MoE) | 整个数据中心 | GPT-4o、Gemini 1.5 |
第三部曲 · 损失与梯度下降
"损失(Loss)"就是模型预测得离答案有多远。训练的过程就是不断调整参数,让损失变小。用的方法叫"梯度下降",你可以想象成:
你被蒙上眼睛放在一座山上,任务是找到山谷(损失最低点)。你唯一能感觉到的,是脚下哪边更陡(坡度)。
你就顺着最陡的方向迈一步,再感受、再迈一步——迈得太大会跳过山谷(学习率过大),迈得太小要走很久(学习率过小)。
迈够多步,你就到谷底了。这就是梯度下降。
大模型训练的三阶段(分开记)
1. 预训练 · Pre-training
喂海量文本(几万亿字),让模型学会"预测下一个词"。这一步做完,它已经知道很多知识,但还不太会"聊天"。
2. 指令微调 · SFT
给它示范"人类的问答对"——你问什么、我应该怎么答。它开始像 ChatGPT 那样对话。
3. 对齐 · RLHF / DPO
用人类的偏好反馈来教它"哪种回答更有用、更礼貌、更安全"。这一步让它变得"讨人喜欢"。
可选:强化学习推理训练
2025 年新趋势(如 DeepSeek-R1、o1)。通过强化学习让模型自己"多想几步再回答",专门提升推理能力。
训练 GPT-4 这样的模型,据估算需要数千万美元算力费;但训完之后推理(就是你每次和它对话)的成本只有几厘钱。训练像盖楼,推理像入住——盖一次很贵,之后天天用便宜。
Transformer · 让 AI 会"读句子"的那块砖
2017 年,Google 一篇叫《Attention Is All You Need》的论文,扔出一个叫 Transformer 的新结构。没有这块砖,就没有今天的 ChatGPT。ChatGPT 里的那个 "T",指的正是它。
"他把苹果放在桌上,然后咬了一口它。"
你一读到"它",脑子里立刻联想到"苹果"而不是"桌子"。为什么?因为你在读"它"的时候,眼睛并不是只看这一个字,而是回过头扫了一遍整句话,找到最相关的那个词。
为什么 Transformer 这么关键
在 Transformer 之前,AI 处理语言用的是 RNN/LSTM 这一类模型——它们像阅读一列排队入场的人,只能一个一个地读,前面的人走远了就容易忘。句子一长就抓不住重点。
Transformer 改成了另一种方式:把整句话摊在桌面上,每个词都能同时看到其他所有词。这让它有两个巨大的优势:
更懂长距离关系
"它"能一眼锁定十几个字之前的"苹果",不再靠一个个传话。
能大规模并行
整个句子同时处理,训练速度远高于 RNN。GPU 因此能被榨到极致——这才让"千亿参数模型"变得可能。
Attention · 用大白话拆一遍
对每个词,模型都做三件事:
- Query(我是谁)生成一个"我要找什么"的向量。
- Key(我这里有什么)句子里每个词都有一个"我是什么"的向量。
- Value(我能给什么)每个词的"内容"本身,等着被取用。
模型用 Query 跟所有 Key 对一遍分(谁跟我最相关),然后按分数把 Value 加权汇总——这就是"这一个词此刻理解到的意思"。整句话都这么处理一遍,就是一层 Attention。
你(Query)走进图书馆,说"我想查关于苹果的事"。图书馆里每本书都有一张目录卡(Key),你依次比对相关度;找到最相关的那几本后,把它们的内容(Value)带回来读。
Transformer 一层 Attention,就是句子里每个词都跑一趟图书馆。
再叠一叠 · 多头 + 多层
- 多头 · Multi-head一个词可以同时从不同角度关注句子("语法角度""语义角度""指代角度"),多头就是多个平行的 Attention。
- 多层 · Stack把这样的 Attention 层叠 12 层、96 层、甚至几百层,就得到了大模型的"深度"。
Transformer 家族树
| 变种 | 特点 | 代表模型 |
|---|---|---|
| Encoder-only | 只做"理解",不生成 | BERT(早期搜索/分类的宠儿) |
| Decoder-only | 只做"生成",一直往后写 | GPT 系列、Claude、DeepSeek |
| Encoder-Decoder | 先理解,再生成 | T5、原始翻译模型 |
| MoE · 专家混合 | 不激活全部参数,只叫醒几个"专家" | Mixtral、DeepSeek-V3 |
Transformer = "注意力机制 × 堆叠层数 × 并行计算"。它让机器第一次能真正"读长句子",从此打开了通往大模型的门。
大语言模型 · 它到底怎么"想"的
你在 DeepSeek 里问一个问题,它秒回一段流利的中文——你会以为它"懂"你。其实它没有懂,它只是在一个字一个字地猜"下一个词最像什么",猜得极其快、极其准而已。这一章就把这个"猜"讲透。
核心秘密 · 一个词一个词地接龙
大语言模型(LLM)的本质任务只有一个:给出前面已经有的文字,预测下一个 token 最可能是什么。
Token 是模型眼里的"字",通常一个 token ≈ 半个到一个汉字,或 3-4 个英文字母。整句话就是几十上百个 token 排队。
模型在心里给候选词打分:
· "北京" → 概率 96%
· "上海" → 概率 2%
· "长安" → 概率 1%
· "薯条" → 概率 0.0001%
它挑一个(通常是概率最高的),输出。然后把"北京"接到句子后面,再问一次"接下来最可能是啥?"——如此循环,一直生成到句号。
那它"懂"吗?争论的两派
不懂派 · 随机鹦鹉
Emily Bender 等语言学家说:LLM 只是"随机鹦鹉"(Stochastic Parrot),它靠统计规律把词接在一起,没有真正的语义理解。
懂了派 · 涌现智能
OpenAI、Anthropic 等则认为:当模型足够大、数据足够多,它内部会"涌现"出对世界的建模能力,虽然机制不同于人脑,但功能上确实在"理解"。
目前主流看法:比"随机鹦鹉"多一点,比"真的理解"少一点。它在语言层面有强大的"操作能力",但缺乏对物理世界、时间流逝、因果关系的真实感受。
影响回答质量的几个"旋钮"
- Temperature · 温度决定它"多敢乱猜"。0 时永远选概率最高的词(很死板);1 时按概率分布随机采样(更有创意)。
- Top-p / Top-k只从概率前几名里挑,防止它跑偏。
- Context Window · 上下文窗口它一次能"看到"多少 token。今天主流是 128K–1M。太长会忘掉前面。
- System Prompt · 系统指令对话最开始的一段"你要扮演谁"的提示,决定了它整段对话的语气。
常听到的几种 LLM 术语,一次讲清
| 术语 | 含义 | 类比 |
|---|---|---|
| Pre-training · 预训练 | 喂海量互联网文本,学会预测下一个词 | 从小读万卷书 |
| Fine-tuning · 微调 | 用少量领域数据,把通用模型改造成专业选手 | 大学毕业后专业培训 |
| RLHF | 用人类反馈做强化学习,让答案更符合人的偏好 | 教练在旁边点头/摇头 |
| RAG · 检索增强 | 先查资料再回答,避免瞎编 | 开卷考试 |
| Distillation · 蒸馏 | 让小模型模仿大模型的行为 | 徒弟学师傅招式 |
| Quantization · 量化 | 把参数从高精度压成低精度,模型变小但略掉点性能 | 把 4K 视频压成 1080P |
| Chain of Thought · 思维链 | 让模型"一步步想"再回答,能显著提升推理 | 写草稿再誊抄 |
| Reasoning Model · 推理模型 | 专门用 RL 训练"多想几步"的新一代模型 | 会打草稿的学霸(o1, R1) |
下次别人对你说"AI 好厉害,好像真的在思考"时,你可以在心里想:它是在做一个天文数字级别的"填空题"——只是这个填空题背后连着的规律,已经足够复杂,复杂到我们看它像人。
多模态 · 看图、听声、生视频
"多模态"意思是:AI 不再只处理文字,还能看图、听声、看视频、甚至生成它们。这是过去两年 AI 圈最热闹的方向——你熟悉的 Sora、Midjourney、GPT-4o 都属于这一类。
一条 15 秒的视频里,你的大脑同时在处理:画面(人在跳舞)、声音(音乐节奏)、文字(字幕)、动作(配合镜头切换)。人脑天生就是多模态的——现在的 AI,也开始学着"用多种感官同时看世界"。
核心思路 · 都变成"向量"
不管是图像、声音还是文字,AI 处理它们的第一步都一样:翻译成一串数字(向量)。这一步叫"嵌入(Embedding)"。
- 文字 → 向量"猫" 变成 [0.12, -0.55, 0.83, ...]
- 图像 → 向量一张猫的图片,也变成同样维度的一串数字
- 语音 → 向量一段"喵喵叫"的音频,也变成一串数字
神奇的是,如果训练得好,这三串数字在"向量空间"里会靠得很近——因为它们都指向同一个概念"猫"。这就是多模态的地基。
想象所有信息(图、字、声)被翻译成同一门"世界语"(向量)。之后 AI 无论输入是什么,都在同一个"语言"里进行推理和转换。
把图翻成字 → 图生文;把字翻成图 → 文生图;把字翻成音 → 文生音——都是同一套思路。
主流的四类"生成 AI"
文本 · Text
ChatGPT、DeepSeek、Claude、通义千问。基座是 Transformer 大语言模型。
图像 · Image
Midjourney、Stable Diffusion、Flux、可灵图片。核心技术:扩散模型(Diffusion)。
视频 · Video
Sora、可灵、即梦、Runway。原理是"图像扩散 + 时间维度",一次生成几秒到几十秒。
语音 · Audio
Suno(歌曲)、ElevenLabs(配音)、GPT-4o Voice(对话)。
扩散模型 · 图像 AI 是怎么"画"的
直觉上你以为 AI 是"画"图,其实它是"从一堆雪花中反向擦出图像":
1. 一张噪声图
先给一张纯"电视雪花"式的图(完全随机像素)。
2. 模型看提示词
比如"一只在草地上的橘猫"。
3. 一步步"擦"掉噪声
每一步模型都猜:如果最终是一只橘猫,那这一步该去掉多少噪声、往哪个方向修。
4. 20–50 步后
雪花逐渐变成一只清晰的橘猫。图,就这么"擦"出来了。
视频生成为什么这么难
- 帧一致性每一帧都要合理,前后帧还要连贯。人物脸不能上一秒是长发下一秒短发。
- 物理常识杯子倒下水要洒出来。AI 常在这里翻车。
- 算力吃紧1 秒视频 = 24 帧图。生成 10 秒视频,就是 240 张相互约束的图。
- 时长限制目前主流上限 10–60 秒。生成一部电影仍然遥远。
多模态的关键是"同一个向量空间"。理解了这一点,你就明白为什么 GPT-4o 能同时看图、听声、说话——因为对它来说,这些东西说到底都是一串数字。
提示词工程 · 会问,比会用更重要
"同样一个 AI,为什么别人用起来神通广大,我用起来废话连篇?"——差距往往不在模型,而在提问。这一章教你怎么问。
你对服务员说"随便来点吃的"——上来一盘白饭。
你说"来份牛肉盖饭,米饭少一点,牛肉多要点,加一个煎蛋七分熟,不要葱花"——正合胃口。
对 AI 说话也一样:信息越具体、要求越明确,你得到的东西就越接近你想要的。
一个好提示词的五要素
| 要素 | 作用 | 举例 |
|---|---|---|
| 角色 · Role | 让 AI 站在合适的立场 | "你是一位资深初中数学老师……" |
| 任务 · Task | 明确要它做什么 | "请把下面这道二次方程题讲给一个九年级学生听" |
| 输入 · Input | 提供必需的原始素材 | 题目原文、要分析的段落、要翻译的原文…… |
| 要求 · Constraints | 限制风格、长度、格式 | "分三步、不要用专业术语、控制在 300 字以内" |
| 格式 · Format | 指定输出结构 | "用 Markdown 表格返回、每行一条" |
三个立刻能用的写法模板
你是【一名 XX 领域的专家】。请【完成一件具体的事】。要求:
1. ......
2. ......
3. ......
下面是几个例子:
输入:X1 → 输出:Y1
输入:X2 → 输出:Y2
现在轮到你:
输入:X3 → 输出:?
——给它两三个例子,比讲一百句话都管用。
请一步步思考再给出答案。先写出你的推理过程,再给最后结论。
——对数学、逻辑、代码类问题,这一句能显著减少错误。
十条私藏心法
- 01 明确受众"讲给一个 8 岁小孩听"和"讲给博士生听",答案天差地别。
- 02 给它角色"你是……"能激活模型对应的知识分布。
- 03 用示例代替解释给两个例子比写五百字要求管用。
- 04 一次一件事别把"总结 + 翻译 + 找错 + 出题"堆在一个提示里。
- 05 让它先复述"先复述我的要求,再开始答题"——能减少偏题。
- 06 给它打分标准"好答案的标准是:A + B + C",它就会照这个标准写。
- 07 让它慢慢想"一步步思考"、"先列大纲再写正文"。
- 08 输出结构化让它输出 JSON、表格、Markdown,方便你处理。
- 09 允许它说不知道"如果不确定就说不知道"——降低幻觉。
- 10 迭代式对话第一次答不好没关系,指出问题让它再改一版。
常见反面教材
"帮我写点东西"
没主题、没长度、没风格、没受众。AI 只能瞎写。
"翻译一下"
翻成哪种语言?正式还是口语?给别人看还是自用?都没说。
"这段代码有什么问题"
要指出 bug?要重写?要加注释?请明确目的。
你的提示词质量决定了 AI 回答的天花板。"提示词工程"不是什么玄学,就是"把话说清楚"这件小学生功夫,只是现在有了新用武之地。
AI 智能体 · 从"回答问题"到"自己干活"
2024 年之后,AI 圈最火的词从"大模型"变成了"Agent(智能体)"。它不再只是回答你一句"这个怎么做",而是自己动手把这件事做完——查资料、写文档、订机票、跑代码、装软件……
普通聊天 AI:你问导购"这双鞋怎么样",他答一句话,然后等你下一句问题。
AI 智能体:你雇了一个私人助理,说"帮我买一双去日本要穿的防水徒步鞋,预算 800,明天到"。他自己去网站搜、比价、看评论、下单、跟踪物流,做完再回来告诉你结果。
一个 Agent 的四个零件
大脑 · LLM
负责思考、规划、决策。用的是 GPT / Claude / DeepSeek 这类大模型。
记忆 · Memory
短期:本次对话上下文;长期:把重要信息存到数据库,之后能查回来。
工具 · Tools
能调用外部功能:浏览网页、执行代码、查数据库、发邮件、订机票、控制电脑鼠标。
循环 · Loop
"思考→用工具→看结果→再思考",直到任务完成。就像人做事的心里循环。
它是怎么"自己干活"的(ReAct 模式)
今天大多数 Agent 用一种叫 ReAct(Reason + Act)的思路,反复三步:
Thought · 想
"用户要我订机票。我需要先查航班。"
Action · 做
调用"搜索航班"这个工具,参数:北京→东京,7月20日。
Observation · 看
工具返回一堆航班列表。
循环
回到"想"这一步:"下一步我要挑一个便宜且时间合适的。"…… 如此循环直到订好票。
典型的 Agent 产品长什么样
| 类型 | 代表产品 | 能干的事 |
|---|---|---|
| 通用助理 | ChatGPT (with Agent mode)、Claude Computer Use、Manus | 浏览网页、写文档、订东西 |
| 编程 Agent | TRAE、Cursor、Devin、Cline | 读懂整个项目、写代码、跑测试、修 bug |
| 研究 Agent | Perplexity、GPT Deep Research | 自动多轮搜索、整理成一份研究报告 |
| 数据分析 | Julius、Advanced Data Analysis | 上传表格自动出图、跑统计 |
| 行业 Agent | 各类客服、法务、医疗 Copilot | 结合企业知识库,替员工分担重复工作 |
三个新兴关键词
- RAG · 检索增强生成先"查资料",再回答。让 AI 用你自己的文档、公司知识库、最新新闻回答——大幅降低幻觉。
- MCP · 模型上下文协议让不同 AI 应用能调用同一批工具的"通用接口标准",2024 年由 Anthropic 提出,正在快速普及。
- Multi-Agent · 多智能体协作让多个 Agent 分工——一个当"经理"、一个当"程序员"、一个当"审校",像一个小公司。
Agent 是 2025 年 AI 落地的核心趋势,但它仍然经常翻车——中途卡住、逻辑跑偏、把网页看错。它更适合"重复但不严肃"的任务,重要事情务必人工复核。
AI 生态地图 · 你听过的那些名字是干嘛的
OpenAI、Anthropic、DeepSeek、英伟达、Hugging Face……你在新闻里天天看到这些名字,但它们到底做什么?这一章帮你在心里画一张 AI 世界的地图。
产业分层 · 从底到顶
| 层 | 做什么 | 代表玩家 |
|---|---|---|
| 芯片 · Hardware | 造 GPU 芯片,AI 的"能量来源" | NVIDIA、AMD、华为昇腾、寒武纪 |
| 算力云 · Cloud | 租 GPU 集群给别人训练模型 | AWS、Azure、GCP、阿里云、火山引擎 |
| 基础模型 · Foundation | 训练出通用大模型(万亿参数) | OpenAI、Anthropic、Google、DeepSeek、Meta、Mistral |
| 开源社区 · Open | 发布免费权重、提供工具 | Hugging Face、Meta Llama、Qwen、DeepSeek 开源版 |
| 基础设施 · Infra | 做训练/推理框架、向量数据库、Agent 框架 | PyTorch、vLLM、LangChain、Pinecone |
| 应用层 · App | 把大模型包装成产品给普通用户 | ChatGPT、Claude、Perplexity、Midjourney、Cursor、TRAE |
| 行业方案 · Vertical | 专门服务某一个行业 | 医疗影像 AI、法律 AI、教育 AI、金融风控 |
大模型花名册(截至 2026)
美国阵营
OpenAI · GPT-4o / o3 / o4,行业标杆
Anthropic · Claude,长文本与安全性见长
Google · Gemini,多模态与超长上下文
Meta · Llama,开源模型的旗手
xAI · Grok,Elon Musk 主导
中国阵营
DeepSeek · 深度求索,高性价比与推理见长
Qwen · 通义千问 · 阿里,开源生态强
豆包 / Doubao · 字节,超大规模用户
文心一言 · 百度
Kimi · 月之暗面,长文本擅长
智谱清言 · GLM · 清华系
欧洲与其他
Mistral · 法国,开源与效率
Cohere · 加拿大,企业市场
Nvidia NIM · 提供推理服务
开源明星
Llama 系列、Qwen 系列、DeepSeek-V3/R1、Mistral、Phi、Gemma——你能在家跑的都在这里。
图像 / 视频 / 语音方向的玩家
| 方向 | 代表产品 | 擅长 |
|---|---|---|
| 文生图 | Midjourney、Flux、Stable Diffusion、可灵图片 | 艺术风格 |
| 文生视频 | Sora、可灵、Runway、即梦、Veo | 短视频、创意广告 |
| 图 / 视频编辑 | Adobe Firefly、Pika、Pixverse | 精细化编辑 |
| 音乐生成 | Suno、Udio | 整首歌一键生成 |
| 配音 / 克隆声 | ElevenLabs、火山引擎、字节剪映 | 拟人声、多语言 |
你需要认识的开发者工具
- Hugging FaceAI 界的 GitHub,找模型和数据集就上这里。
- Ollama一行命令在本机跑 Llama、Qwen、DeepSeek,隐私和折腾兼得。
- LangChain / LlamaIndex给开发者搭 Agent、RAG 应用用的框架。
- Cursor / TRAE / ClineAI 原生编辑器,写代码效率飞跃。
- Perplexity带引用的 AI 搜索——写论文查资料的新入口。
下次听到一个新 AI 公司/产品,问自己一个问题就够了——它在哪一层?是造模型?造应用?还是行业方案?分清了这一点,很多新闻里的"AI 大战"就不再乱成一锅粥。
AI 的局限 · 幻觉、偏见与它不会的东西
学 AI,光看它的"厉害"是不够的。你必须知道它在哪些地方会翻车——这决定了你什么时候能信它、什么时候必须自己再看一眼。
局限一 · 幻觉(Hallucination)
AI 会一本正经地胡说八道:编造参考文献、伪造名人名言、把两个人的经历拼在一起。这不是它故意的——它是"预测下一个词"的机制决定的:只要那个词看起来合理,它就说出来,哪怕事实上根本不存在。
2023 年美国一位律师用 ChatGPT 写辩护词,AI 引用了 6 个"看起来很真"的判例。律师没核对就交了法庭——结果全是编的。律师被罚款、名誉受损。
怎么降低幻觉?
- 让它有依据给它资料让它"引用"(这就是 RAG)。
- 允许它说不知道"如果不确定就说'我不确定'"。
- 让它多想使用推理模型(o1、R1),或加"一步步想"提示。
- 追问来源"你的这个数据来自哪里?给我原文链接。"
局限二 · 偏见(Bias)
AI 从互联网学习,互联网上有什么,它就学什么——包括各种性别、种族、地域的偏见。它对某些群体的回答可能不知不觉地带有刻板印象。
常见表现:护士默认是女性、CEO 默认是男性;某些国家名字关联负面语义;生成图像时特定职业总是特定人种。
局限三 · 时效性
模型训练数据有截止日期。如果你问它今年发生的事、最新的新闻、最新版软件的用法——它可能一无所知,或者用旧信息瞎编。带"联网搜索"的模型好一些,但也不是每次都触发。
局限四 · 它不擅长的活
精确数学
大数加减、多位数乘除、复杂公式,它常常翻车。让它调工具(计算器 / 代码)会好很多。
实时信息
股票价格、比赛比分、天气——没联网时它会瞎猜。
物理常识
"把水杯倒过来,水会怎样"——它答对但生成视频常出错,因为它不"体验"重力。
长逻辑链
需要 20 步以上的严密推理,它会中途丢线索。
局限五 · 隐私、版权与安全
- 隐私你输入的东西可能被用来训练模型。敏感信息(身份证、银行卡、公司机密)绝对不要粘到公共 AI 里。
- 版权AI 生成的内容归谁?训练用的原始数据版权怎么算?法律仍在追赶技术。
- 深度伪造换脸、AI 换声电话诈骗、AI 合成的假新闻——2024 年起已是社会问题。
- Prompt 注入恶意用户可以骗过 Agent 让它做不该做的事。企业部署 AI 时必须防这个。
把 AI 想成一个博学但不上心的实习生:
· 他知识面很广——可以放心让他起草;
· 他会瞎编数字——重要事情你必须自己核;
· 他没有职业操守——不要给他公司机密;
· 他会讨你欢心说好听的——你要有自己的判断力。
用 AI 时永远记住一句话:"AI 的输出是草稿,不是终稿"。让它替你把 80% 的活干完,剩下 20% 靠你自己的判断收尾——这样效率最高、风险最低。
与 AI 共处 · 学习、工作与未来
最后一章,我想以老师的身份和你说几句心里话。AI 会怎么改变你的学习、工作和生活?与其焦虑"我会不会被替代",不如学会"和它一起把事做好"。
三个必须先想清楚的问题
AI 会取代我的工作吗?
短期内被 AI 全盘替代的工种其实很少;但不会用 AI 的人会被会用 AI 的人替代。这是几乎所有行业分析的共识。
我还需要学 XX 吗?
需要。AI 帮你干活,但它会瞎编——你要有能力判断它对不对。基础知识、专业判断力、批判性思维,比过去更重要。
孩子从小该不该接触 AI?
该。但重点不是让孩子"用 AI 代写作业",而是让他学会怎么问、怎么核实、怎么判断——这是新时代的读写能力。
与 AI 相处的四种姿势
| 姿势 | 什么意思 | 结果 |
|---|---|---|
| 拒绝 | "这东西不可靠",坚决不用 | 短期舒服,长期被淘汰 |
| 迷信 | "AI 说什么都是对的",全盘照搬 | 被幻觉坑,还失去判断力 |
| 玩具 | 只用来写段子、生表情包 | 浪费了它的真正生产力 |
| 协同 ✓ | 把 AI 当"实习生 + 助理 + 陪练" | 效率翻倍、能力反而更强 |
把 AI 变成"你的私人老师"(学习场景)
- 当讲师"用我能听懂的话讲一遍 XX 概念,配一个生活例子"
- 当出题"围绕这个知识点出 5 道选择题,一道综合题,附答案解析"
- 当陪练"你扮演面试官/客户/口语搭子,跟我角色扮演 5 轮"
- 当纠错"这是我的作文/代码/论证,请找出问题并给出改进建议"
- 当翻译"帮我把这段英文论文翻成中文,专业术语保留原文并加注解"
把 AI 变成"你的助手"(工作场景)
- 写作先自己写 30% 思路,让 AI 扩写;再自己改;再让它润色。三轮下来又快又稳。
- 阅读把长报告丢给它总结要点、抽出数据、生成脑图。
- 编程用 Cursor / TRAE 这类 AI 编辑器,写代码效率能提升 2–3 倍。
- 研究Perplexity 找资料、Claude 分析、Gemini 处理长文档——组合拳最猛。
- 重复劳动批量改标题、批量分类邮件、批量整理表格——一个提示词能替你干半天。
三条我希望你记住的话
AI 是放大器,不是替代品。它会把有能力的人放大成"超级个体",也会把想偷懒的人放大成"更懒的人"。你想要哪一种,取决于你怎么用它。
提问的能力,比记忆的能力更重要。过去我们比谁记得多、算得快,未来我们比谁能问出好问题、判断出对错。这是一次能力的重估。
保持人类的部分。AI 能写文字、能生成图,但它不能替你去恋爱、去带孩子、去感受一场雨、去写下"我此刻的心情"。留下这些不能被替代的部分,是我们对抗被工具异化的底牌。
回到最开始那句话——AI 就是一个"读过整座图书馆的孩子"。你已经知道了它的原理、能力、局限、以及怎么用它。
从今天起,它不再是新闻里那个神秘的名词,而是你桌上一个能被你用得很好的工具。
祝你玩得开心,也用得有分寸。