强化学习智能体是根据观察选择动作,并利用环境反馈改进决策的对象。它可能是一张小表,也可能是神经网络,并不一定是聊天机器人。理解它最直接的办法,是把一次行动拆开,看谁作决定、谁改变场景、谁给奖励。
用一个迷宫例子划清职责
下面是自拟的教学场景:一个机器人从起点走到出口,每走一步扣 1 分,到达出口加 10 分,碰墙则留在原位。这里的机器人决策程序是智能体;迷宫地图、移动规则和计分规则属于环境。

| 字段 | 这次行动的示例 | 由谁产生 |
|---|---|---|
| 观察 | 当前位置 (1, 1),右侧可走 | 环境提供 |
| 动作 | 向右移动 | 智能体选择 |
| 下一观察 | 当前位置变为 (1, 2) | 环境执行规则后返回 |
| 奖励 | -1 | 环境按规则计算 |
| 结束标记 | 尚未到出口 | 环境判断 |
奖励不是人类对每一步的正确答案标注。智能体可以先走错路,再从多次经历中调整选择。判断它是否学习,要看决策参数有没有依据经历更新,而不是看它有没有移动。
先运行一次没有学习的交互
准备 Python 环境,安装 gymnasium 后,把下面代码存为 first_loop.py 并运行。它使用 CartPole 小车环境,只选随机动作,不包含训练过程。这有助于先确认交互链路,避免把“能运行”误认成“已经学会”。
import gymnasium as gym
env = gym.make("CartPole-v1")
env.action_space.seed(7)
observation, info = env.reset(seed=7)
total = 0.0
for step in range(20):
action = env.action_space.sample()
next_observation, reward, terminated, truncated, info = env.step(action)
print(step, action, reward, terminated, truncated)
total += float(reward)
observation = next_observation
if terminated or truncated:
break
print("本轮累计奖励:", total)
env.close()
文件保存后,在该文件所在目录运行以下命令;若使用虚拟环境,应使用该环境里的 Python。
python -m pip install gymnasium
python first_loop.py
每一行打印的是一次交互;两个结束标记中任意一个为真,就结束本轮。若还想继续,先调用 reset(),再开始新一轮。本文代码是入门示例,未在你的设备上运行,也没有展示训练成绩。
从交互走到学习,还缺什么
下一步要增加的是更新规则。例如,表格型 Q 学习会保存“当前情况采用某个动作的价值估计”,并根据实际奖励与下一情况的价值修改这个估计。此后选择动作时使用更新后的表,而不是一直随机采样。
你可以用三项记录核对程序:行动前的策略或参数、交互得到的奖励与下一观察、更新后的参数。如果只看见动作和奖励,却没有任何更新,则目前运行的是固定或随机策略。训练完成后用固定评估场景检查表现,还要与随机策略比较;一次成功到达目标不足以证明学习稳定。
它和大模型智能体有什么区别
大模型智能体常通过提示词、工具调用和流程编排完成任务;强化学习智能体则强调依据奖励调整决策。二者可以组合,但配置三个聊天角色并不自动构成强化学习,也不意味着这些角色在持续更新模型。
迷宫奖励是人为设计的教学规则,实际业务的奖励可能遗漏成本或鼓励错误行为。先在模拟环境检查规则,不能把这个例子直接用于有真实损失的控制任务。
继续阅读
概念与交互接口依据 2026 年 10 月 3 日读取的 OpenAI Spinning Up 强化学习概念说明及 Gymnasium 基本用法。安装后以实际包版本对应的文档为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32946.html