智能的本质,就是将一个观察映射为一个动作。
我们常惊叹于 AlphaGo 落子的神妙,或自动驾驶汽车在十字路口的从容。这些系统的内核,都在做同一件事:看当下,定决策。在人工智能(尤其是强化学习)的语言里,这个“看”对应着状态(State / Observation),这个“定”对应着动作(Action)。而所有可能“看”到的画面,和所有可能“做”出的选择,就构成了两个核心数学空间:观察空间(Observation Space) 与 动作空间(Action Space)。
观察空间,是智能体所能接收到的所有可能信息的集合。它不一定是物理世界的全部,而是智能体能够感知的那一部分。
(车速, 方向盘角度, 与前车距离, 左右车道线曲率),这构成一个 4 维连续空间,每个维度取值为实数,即 $\mathcal{O} \subseteq \mathbb{R}^4$。关键点:观察空间是智能体决策的依据。如果观察空间缺少关键信息(比如自动驾驶没看到湿滑路面),那么再好的决策映射也会失效。
动作空间,是智能体在某个观察下可以执行的所有可能操作的集合。动作的粒度直接决定了问题的复杂度。
有了观察空间 $\mathcal{O}$ 和动作空间 $\mathcal{A}$,智能体就是一个确定的或随机的映射:
$$ \pi: \mathcal{O} \rightarrow \mathcal{A} $$
这个映射 $\pi$ 被称为策略(Policy)。如果映射是确定性的,给定观察 $o$,永远输出同一个动作 $a = \pi(o)$。如果是随机性的,则输出动作的概率分布 $a \sim \pi(\cdot | o)$。
学习的本质,就是从海量数据中(观察-动作-奖励三元组)搜索出一个最优的映射 $\pi^*$,使得累积奖励最大化。
| 维度 | 围棋(AlphaGo) | 自动驾驶 |
|---|---|---|
| 观察空间 | $19 \times 19$ 棋盘状态(离散,$3^{361}$) | 多传感器融合(连续,高维,如 224x224x3 图像 + 雷达点云) |
| 动作空间 | 19×19 个落子点 + 停手(离散,共 362 个) | 油门、刹车、转向角(连续,如 $\mathbb{R}^3$) |
| 映射难度 | 组合爆炸,但规则明确 | 连续控制,且需处理不确定性和延迟 |
若将时间 $t$ 纳入考虑,则完整的数据驱动决策链为:
$$ o_t \xrightarrow{\text{策略 } \pi} a_t \xrightarrow{\text{环境 }} o_{t+1}, r_t $$
其中 $r_t$ 是奖励信号。整个强化学习目标就是找到最优策略:
$$ \pi^* = \arg\max_{\pi} \mathbb{E}\left[ \sum_{t=0}^{T} \gamma^t r_t \right] $$
这里 $\gamma \in [0,1]$ 是折扣因子。
数据(观察)是原料,决策(动作)是产品,而智能体就是那座将原料转化为产品的工厂。 观察空间定义了工厂所能接收的原材料种类,动作空间定义了工厂所能生产的产品规格。而真正的智慧,藏在那个从 $\mathcal{O}$ 到 $\mathcal{A}$ 的映射函数里——它可以是线性回归,也可以是千层神经网络,但本质从未改变:在不确定的世界中,基于有限信息,做出最优选择。
理解了这一点,你就已经掌握了人工智能决策大厦的第一块基石。