Niina

Niina

译

OpenAI Spinning Up 教程第三部分的全文翻译:推导最简单的策略梯度、log-derivative trick、EGLP 引理、reward-to-go 与基线,配 PyTorch 示例代码。

译

OpenAI Spinning Up 第二部分的全文翻译:无模型与基于模型的 RL、策略优化与 Q-learning 的取舍,以及规划、专家迭代和经验增强等方法。

译

OpenAI Spinning Up 教程第一部分的全文翻译:智能体与环境、状态与观测、动作空间、策略、轨迹、奖励与回报、价值函数、贝尔曼方程、优势函数,附 MDP 形式化。

简单聊聊对 AI Agent 行业的理解

2026年6月20日·

写这篇文章的初衷,是我发觉逐渐忘了前两个月的 AI/LLMs 是什么样的能力和情况了。意识中似乎某些在突然加速,但理性和直觉告诉我这不对,作为行内人,我知道这是一个渐进的、累积的过程。我想自己回忆一下,Agent的发展。

© 2024 - 2026 Niina's Blog

RSS