多智能体博弈关注的是:一个人的选择结果依赖其他人的选择。把收益写成双人矩阵,可以直接检查各人的最佳回应。下面使用自造合作与背离的两动作任务,避免把“大家一起做事”误当成一定存在共同最优策略。
先统一收益的读法
| A / B | B合作 | B背离 |
|---|---|---|
| A合作 | 3, 3 | 0, 5 |
| A背离 | 5, 0 | 1, 1 |
格子中第一个数字给 A,第二个给 B。A 选择行,B 选择列,二人同时行动。所有数字都是本文演示收益,不对应真实报价或业务利润。双方合作时团队总和 6,双方背离时总和 2,但每个人面对合作的对手时都能从背离获得更高的个人收益。

逐列逐行找最佳回应
固定 B 合作,A 比较 3 与 5,最佳回应是背离;固定 B 背离,A 比较 0 与 1,仍是背离。同理,B 在 A 任一选择下也偏好背离。因此双方背离是纯策略纳什均衡:任何一方单独改动作都不能提高自己的收益。这个稳定点不等于团队收益最大的双方合作。
保存 game_table.py,用 Python 3 执行 python game_table.py。程序检查每个联合动作是否允许单方获利改变,枚举的前提是收益表完整、动作集合只有这里的两个。
A = [[3, 0], [5, 1]]
B = [[3, 5], [0, 1]]
equilibria = []
for i in range(2):
for j in range(2):
a_best = A[i][j] == max(A[r][j] for r in range(2))
b_best = B[i][j] == max(B[i][c] for c in range(2))
if a_best and b_best:
equilibria.append((i, j))
team_best = max(((i, j) for i in range(2) for j in range(2)),
key=lambda ij: A[ij[0]][ij[1]] + B[ij[0]][ij[1]])
print("pure equilibria:", equilibria, "team best:", team_best)
assert equilibria == [(1, 1)] and team_best == (0, 0)
应打印均衡 [(1,1)] 和团队最优 (0,0)。若换成零和收益,团队总和可能对所有动作都相同,不能再用最大总和区分好坏。若纯均衡列表为空,也不代表没有均衡;有限博弈可能需要混合策略。
把矩阵结论放回真实任务
在强化学习里,策略优化面对的其他智能体可能同时学习,收益和访问到的状态也随之变化。本表只是一个固定的一步博弈,没有状态转移、长期折扣或学习更新;不能据此预测重复交互中的最终行为。对长期任务还要定义信息、转移与每个体回报。
读者下一步可以把实际任务的两个主要动作列出来,分别填上每个人关心的可验证收益,再检查是否出现个人激励与团队目标冲突。不能先用团队平均分替代各人收益,也不能把“均衡”当作公平、合作或道德优越的证明。
资料与核对依据
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32994.html