全站搜索

按 Esc 关闭 · Cmd/Ctrl + K 打开

模型选择依据

角色与权重更新来自论文案例记录;“为什么选它”只有在论文或代码明确给出时才会写入,未知不会被推断成事实。

论文模型角色与选择依据状态
模型角色权重更新选择依据
GPT-4baseline未记录:需回到论文/代码核验
GPT-3.5 Turbobaseline未记录:需回到论文/代码核验
text-davinci-003baseline未记录:需回到论文/代码核验
Llama 2 70B Chatbaseline未记录:需回到论文/代码核验

WebArena: A Realistic Web Environment for Building Autonomous Agents

2023-07-25 · 已核验

论文信息

进化对象
网页智能体策略、智能体评测
基准测试
WebArena
类别
网页智能体、工具调用、自进化智能体
模型关系
4 个

从这篇论文开始研究

选择研究模式后,论文和原始模型会进入工作台上下文。

复现状态

代码 尚未核验
权重 尚未核验
配置 尚未核验
环境 尚未核验

尚未补充结构化复现记录。

模型角色拓扑

这里只展示数据明确记录的角色与模型关系,不推断未记录的 workflow 边。

基线
GPT-4GPT-3.5 Turbotext-davinci-003Llama 2 70B Chat

当前论文记录没有 workflow 边;上方仅展示已记录的角色拓扑,不把 Actor、Environment、Critic 或 Optimizer 关系当作事实。

模型角色

GPT-4

基线 · 未更新权重 · GPT-4 作为 WebArena 智能体参与基准测试。

GPT-3.5 Turbo

基线 · 未更新权重 · GPT-3.5 Turbo 作为 WebArena 智能体参与基准测试。

text-davinci-003

基线 · 未更新权重 · text-davinci-003 作为 WebArena 智能体参与基准测试。

GPT-3.5

Llama 2 70B Chat

基线 · 未更新权重 · Llama-2-70B-Chat 作为开源 WebArena 智能体参与基准测试。