Skip to content

开源项目与工具集

先收藏这些,它们持续追踪领域最新进展:

仓库维护方说明
Awesome-Self-Improving-Agents清华 C3I自改进 Agent 综述配套,覆盖 harness/skills/memory/meta-evolution
Awesome-Self-Evolving-Agents厦大 DeepLIT配套 Survey 论文,按 What/When/How/Where 分类
awesome-agent-evolutionEvoMapAgent 进化、记忆系统、多智能体架构合集
Awesome-Self-Improving-AgentsFrontisAI”Agents in the Era of Experience” 配套

项目Stars语言核心能力链接
Promptfoo5k+TypeScriptPrompt/Agent 对比测试、红队扫描、CI 集成GitHub
DeepEval4k+Python14+ 内置指标、pytest 集成、Confident AI 平台GitHub
RAGAS7k+PythonRAG 专项评估(faithfulness/relevance/context)GitHub
AgentEvalPythonAgent 专项评估框架GitHub
agent-eval-frameworkPython生产级 Agent 评估+持续改进GitHub
项目定位自部署核心能力链接
Langfuse开源 Observability✅ DockerTrace、Scoring、Prompt 管理、数据集GitHub
Arize Phoenix开源 ObservabilityTrace、LLM Eval、Embedding 分析GitHub
OpenLITOpenTelemetry for LLM标准化 trace 采集、Grafana 集成GitHub
LatitudeAgent Observability部分多 Agent trace、评估、prompt 版本GitHub
项目评估对象说明链接
AgentBenchAgent 综合能力8 种环境(OS/DB/Web/Game…)GitHub
SWE-bench代码 Agent真实 GitHub issue 修复GitHub
GAIA通用 Agent多步推理 + 工具使用HuggingFace
ToolBench工具使用16000+ 真实 APIGitHub
τ-bench对话式 Agent模拟用户多轮交互GitHub

项目核心思想适用场景链接
DSPy声明式 Prompt 编程 + 自动编译Pipeline 级优化,few-shot 自动选择GitHub
TextGrad文本梯度反向传播单 prompt 深度优化GitHub
OPROLLM 搜索最优 prompt目标明确的 prompt 搜索Paper
EvoPrompt遗传算法 prompt 进化大规模 prompt 变体搜索Paper
PromptBreeder自引用 prompt 进化Prompt + 变异策略协同进化Paper
项目核心思想链接
Reflexion语言强化学习,经验存文字记忆GitHub
LATS树搜索 + 反思,探索多条推理路径GitHub
Memento-II有状态反思记忆Paper
MARS记忆增强 + 反思自改进Paper
MemoryBank长期记忆管理与遗忘机制GitHub
项目说明链接
DSPy 主仓库Stanford NLP 维护,核心框架GitHub
dspy-0to1-guide从零到一实战教程GitHub
dspy-agent-forgeDSPy + Agent 结合示例GitHub
AutoDSPy用 RL 自动化 DSPy 模块设计Paper (EMNLP 2025)

项目出处进化目标成熟度链接
EvoAgentX开源社区完整自进化生态系统活跃开发中GitHub
AgentEvolver阿里 ModelScopeAgent 工作流自进化论文配套GitHub
EvolveRICML 2026经验驱动全生命周期论文配套GitHub
EvoMaster上海交大科研级大规模进化学术GitHub
AHEarXiv 2604.25850Agent Harness 自进化论文配套GitHub
项目核心思想链接
ADAS用代码搜索自动设计 Agent 系统Paper (ICLR 2025)
MetaAgent-X端到端 RL 突破多智能体设计上限Paper
Meta-Agent (FSM)基于有限状态机自动构建多 Agent 系统Paper
High-Order ADAS高阶自动 Agent 系统设计IEEE
项目思路链接
VoyagerMinecraft Agent 自动发现技能 + 技能库GitHub
Claude Code Skills文件系统承载的技能定义与自动触发Docs
code-voyagerVoyager 思路用于代码 AgentGitHub
Anthropic Agent SkillsSDK 级别的技能系统Blog

供参考架构设计思路,不一定需要直接使用:

平台定位开源程度特点
BraintrustEval + 数据集 + 优化部分开源完整的 eval pipeline
LangSmithTrace + Eval + 标注闭源LangChain 深度集成
HoneyHiveEval + Observability闭源企业级评估平台
AgentOpsAgent 可观测性开源 SDK专注 Agent trace
Weights & Biases WeaveLLM 实验追踪部分ML 实验管理背景

Terminal window
# 1. 用 Promptfoo 跑你的第一个 eval
npx promptfoo@latest init
npx promptfoo@latest eval
# 2. 或用 DeepEval (Python)
pip install deepeval
deepeval test generate # 自动生成测试用例
  1. Langfuse — 部署 trace 收集 (docker compose up)
  2. DeepEval — 编写评估脚本
  3. DSPy — 跑通一次 prompt 自动优化
  1. 读完 Awesome-Self-Improving-Agents (清华) 的分类
  2. 跑通 EvoAgentX 的 examples
  3. 复现 EvolveR 的实验

本文会持续收录新的开源项目。最后更新时间见页面顶部。

如果你发现了好的开源项目,欢迎通过 GitHub Issue 提交。