我们读了什么,以及为什么读。

关于用户仿真与自我改进智能体的已发表工作的简短笔记。研究是别人的,评论是我们自己的,每一篇都附上原论文链接。

Generative Agents: Interactive Simulacra of Human Behavior

Park et al. · Stanford University and Google Research · arXiv:2304.03442 (2023)

二十五个由语言模型驱动的角色住在一个小型沙盒小镇里,记忆、反思和规划连在一起,论文观察的是没人干预时他们会做什么。有意思的结果不是某一个具体行为,而是相当简单的机制就能长出可信的社交行为:记住发生过什么,偶尔回头反思,再据此规划下一步。

我们为什么读它。 它清楚地论证了仿真用户值得当成评测工具认真对待,而且对失败模式很坦诚:记忆检索取错了东西,行为逐渐滑向礼貌和附和。这两样正是我们在自己的画像上要盯的问题。

阅读笔记用户仿真

Voyager: An Open-Ended Embodied Agent with Large Language Models

Wang et al. · NVIDIA, Caltech, UT Austin, Stanford and Arizona State University · arXiv:2305.16291 (2023)

一个智能体在无人干预、也不做微调的情况下玩 Minecraft。它自己定下一个目标,写一段程序去达成,检查结果,再把有效的程序存进一个不断变大的技能库,以后随时调用。能力以可复用代码的形式积累在这个库里,而不是靠把提示词写得更长。

我们为什么读它。 它和我们关心的自我改进闭环是同一个形状:尝试、验证、留下有效的、下一轮复用。论文也很坦率地指出,进展几乎完全取决于智能体拿回来的反馈质量。所以我们把评测排在自主之前。

阅读笔记自我改进的智能体
关于这些笔记

每一篇笔记都是我们重新写的概述,不是原文摘录。署名和所有创新的归属都属于原作者,请去读他们的论文,而不是我们这一段。