Watch an agent learn the shortest path, one episode at a time.
每个格子是一个状态,4 个动作(上下左右)各有一个 Q(s,a) 值,存在一张表里。
智能体用 ε-greedy 行动:以概率 ε 随机探索,否则选当前 Q 值最大的动作。每走一步用
时序差分更新 Q(s,a) ← Q(s,a) + α·[r + γ·maxₐ′Q(s′,a′) − Q(s,a)]。
奖励:到达目标 +1、踩陷阱 −1、每步 −0.02 鼓励走捷径。热力图画的是状态价值
V(s)=maxₐ Q(s,a),箭头是贪婪策略。随着回合推进、ε 按设定衰减,
价值从目标向外扩散、箭头逐渐指向最短路径——纯表格 RL,无任何外部库。
研究上:这是理解值迭代、credit assignment、exploration–exploitation 折中的最小可视化沙盒, 可扩展到 SARSA、Double-Q、Dyna 规划、奖励塑形或函数逼近(DQN)的教学对照。 产品上:可做成交互式课程组件 / 招生展示 / 技术博客嵌件,把抽象算法变成肉眼可见的涌现。 作品集上:体现把论文级算法压成零依赖、60fps、可分享单文件的工程能力, 适合放进个人主页或 GitHub Pages 作为 RL 入门 demo。