译
OpenAI Spinning Up 教程第三部分的全文翻译:推导最简单的策略梯度、log-derivative trick、EGLP 引理、reward-to-go 与基线,配 PyTorch 示例代码。
OpenAI Spinning Up 教程第三部分的全文翻译:推导最简单的策略梯度、log-derivative trick、EGLP 引理、reward-to-go 与基线,配 PyTorch 示例代码。
OpenAI Spinning Up 第二部分的全文翻译:无模型与基于模型的 RL、策略优化与 Q-learning 的取舍,以及规划、专家迭代和经验增强等方法。
OpenAI Spinning Up 教程第一部分的全文翻译:智能体与环境、状态与观测、动作空间、策略、轨迹、奖励与回报、价值函数、贝尔曼方程、优势函数,附 MDP 形式化。
读 Anthropic《Towards Monosemanticity》。从难以解释的神经元出发, 讲清superposition为什么让单个神经元混成一团, SAE怎么把多语义的激活分解成单语义特征。
写这篇文章的初衷,是我发觉逐渐忘了前两个月的 AI/LLMs 是什么样的能力和情况了。意识中似乎某些在突然加速,但理性和直觉告诉我这不对,作为行内人,我知道这是一个渐进的、累积的过程。我想自己回忆一下,Agent的发展。