✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

从数据到决策:认识“状态”与“动作”

创建时间:2026-08-05 更新时间:2026-08-05 阅读次数:1003 次

智能的本质,就是将一个观察映射为一个动作。

我们常惊叹于 AlphaGo 落子的神妙,或自动驾驶汽车在十字路口的从容。这些系统的内核,都在做同一件事:看当下,定决策。在人工智能(尤其是强化学习)的语言里,这个“看”对应着状态(State / Observation),这个“定”对应着动作(Action)。而所有可能“看”到的画面,和所有可能“做”出的选择,就构成了两个核心数学空间:观察空间(Observation Space)动作空间(Action Space)

1. 智能体的“眼睛”:观察空间

观察空间,是智能体所能接收到的所有可能信息的集合。它不一定是物理世界的全部,而是智能体能够感知的那一部分。

  • 连续观察空间:由实数向量组成,维度固定。例如,自动驾驶的观察可以是 (车速, 方向盘角度, 与前车距离, 左右车道线曲率),这构成一个 4 维连续空间,每个维度取值为实数,即 $\mathcal{O} \subseteq \mathbb{R}^4$。
  • 离散观察空间:有限个可能的观测值。例如,围棋棋盘的状态可以编码为 $19 \times 19$ 的网格,每个格子有“黑/白/空”三种状态,因此总状态数为 $3^{361}$(虽大但有限),属于离散空间。

关键点:观察空间是智能体决策的依据。如果观察空间缺少关键信息(比如自动驾驶没看到湿滑路面),那么再好的决策映射也会失效。

2. 智能体的“手”:动作空间

动作空间,是智能体在某个观察下可以执行的所有可能操作的集合。动作的粒度直接决定了问题的复杂度。

  • 离散动作空间:动作个数有限。例如,Atari 游戏《打砖块》只有 4 个动作(左移、右移、发射、不动),即 $\mathcal{A} = {0,1,2,3}$。
  • 连续动作空间:动作由实数向量表示。例如,机械臂控制需要输出 7 个关节的力矩值,每个值在 $[-1, 1]$ 内连续变化,因此 $\mathcal{A} = [-1, 1]^7$。
  • 混合动作空间:同时包含离散和连续部分。例如,自动驾驶既要选择“变道/直行”(离散),又要控制方向盘转角的具体数值(连续)。

3. 智能的本质:映射函数

有了观察空间 $\mathcal{O}$ 和动作空间 $\mathcal{A}$,智能体就是一个确定的或随机的映射:

$$ \pi: \mathcal{O} \rightarrow \mathcal{A} $$

这个映射 $\pi$ 被称为策略(Policy)。如果映射是确定性的,给定观察 $o$,永远输出同一个动作 $a = \pi(o)$。如果是随机性的,则输出动作的概率分布 $a \sim \pi(\cdot | o)$。

学习的本质,就是从海量数据中(观察-动作-奖励三元组)搜索出一个最优的映射 $\pi^*$,使得累积奖励最大化。

4. 为什么区分这两个空间如此重要?

  • 维度灾难:观察空间的维度每增加 1,所需数据量往往指数级增长。因此,特征工程(选择哪些观察)比算法更重要。
  • 动作约束:动作空间必须反映物理或安全限制。比如,机器人关节不能超过物理限位,否则映射出来的动作就是无效的。
  • 对称性与泛化:好的观察空间设计能利用对称性(如棋盘旋转不变性),让映射更容易学习。

5. 一个直观的类比:下棋 vs. 开车

维度 围棋(AlphaGo) 自动驾驶
观察空间 $19 \times 19$ 棋盘状态(离散,$3^{361}$) 多传感器融合(连续,高维,如 224x224x3 图像 + 雷达点云)
动作空间 19×19 个落子点 + 停手(离散,共 362 个) 油门、刹车、转向角(连续,如 $\mathbb{R}^3$)
映射难度 组合爆炸,但规则明确 连续控制,且需处理不确定性和延迟

6. 从观察到决策的数学统一

若将时间 $t$ 纳入考虑,则完整的数据驱动决策链为:

$$ o_t \xrightarrow{\text{策略 } \pi} a_t \xrightarrow{\text{环境 }} o_{t+1}, r_t $$

其中 $r_t$ 是奖励信号。整个强化学习目标就是找到最优策略:

$$ \pi^* = \arg\max_{\pi} \mathbb{E}\left[ \sum_{t=0}^{T} \gamma^t r_t \right] $$

这里 $\gamma \in [0,1]$ 是折扣因子。

7. 给学习者的实践建议

  • 先离散化:面对连续观察空间,初学者可尝试分箱(Binning)转为离散,降低入门难度。
  • 动作归一化:若动作空间为 $[a_{\min}, a_{\max}]$,训练前通常将动作归一化到 $[-1, 1]$ 或 $[0, 1]$,以稳定神经网络的输出。
  • 观察标准化:对每个观察维度减去均值、除以标准差,使映射学习更平滑。

总结

数据(观察)是原料,决策(动作)是产品,而智能体就是那座将原料转化为产品的工厂。 观察空间定义了工厂所能接收的原材料种类,动作空间定义了工厂所能生产的产品规格。而真正的智慧,藏在那个从 $\mathcal{O}$ 到 $\mathcal{A}$ 的映射函数里——它可以是线性回归,也可以是千层神经网络,但本质从未改变:在不确定的世界中,基于有限信息,做出最优选择

理解了这一点,你就已经掌握了人工智能决策大厦的第一块基石。

本教程共13节,当前为第11节!
本教程最新修订时间为:2026-08-06 21:35:58

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>