2026
-
自私的基因:第 12 章 好人终有好报
TLDR:重复的互动改变了自私的逻辑,当策略可以是友好的、报复性的、宽容的和不嫉妒的时候,合作就变得可行。
-
Sutton RL:第 6 章 - 时间差分学习
TLDR:TD 通过引导当前值估计,将蒙特卡洛采样与动态编程式更新相结合,从部分经验中学习更新。
-
Sutton RL:第 5 章 - 蒙特卡罗方法
TLDR:蒙特卡罗方法从完整的采样片段中学习价值,用无模型的简单性来换取延迟更新和返回方差。
-
Sutton RL:第 2 天 多臂老虎机
TLDR:多臂老虎机通过消除状态转换并将动作价值估计作为中心来隔离探索/利用问题。
-
Sutton 强化学习:第 3 天 动态规划
动态规划是强化学习基于模型的起点:利用已知的 MDP 动力学,贝尔曼方程成为迭代值和策略更新规则。
-
Sutton RL:第 1 天 - RL 问题和 MDP 基础知识
TLDR:RL 是长期奖励的交互:政策选择行动,奖励提供反馈,价值估计未来回报,贝尔曼方程将各个部分连接起来。
-
自私的基因:第 10 章 你为我搔痒,我就骑在你的头上
TLDR:群体生活和明显的利他主义通常可以通过自我保护、亲属关系、剥削、互惠交换和独处的成本来解读。
-
自私的基因:第 9 章 两性战争
TLDR:性冲突始于父母投入的不平等,促使男性和女性在交配、照顾、忠诚和展示方面采取不同的策略。