Skyvern 跑 WebVoyager 实测:Cambridge Dictionary 43 项浏览器自动化任务评估全记录

发布时间:2026/9/13 16:22:24
Skyvern 跑 WebVoyager 实测:Cambridge Dictionary 43 项浏览器自动化任务评估全记录 Skyvern 跑 WebVoyager 实测Cambridge Dictionary 43 项浏览器自动化任务评估全记录【免费下载链接】skyvernAutomate browser based workflows with AI项目地址: https://gitcode.com/GitHub_Trending/sk/skyvernWebVoyager 是业界常用的真实网站端到端智能体评测集本文以本仓库中 Skyvern 在 Cambridge Dictionary剑桥词典官网上的完整评估结果 evaluation/results/webvoyager-Cambridge-Dictionary.md 为主体逐项解读 43 个真实浏览器任务的通过情况、结构化输出与失败原因并结合 evaluation 目录下的评测脚本与数据集源码说明 Skyvern 是如何被批量投喂任务、执行浏览器操作、产出结构化 JSON 结果并自动判定的。读完本文你将能完整理解这套真实网站 自动化浏览器 LLM 断言的评测方法论并掌握在本仓库中复现同类评估的具体命令与数据流。一、评估背景WebVoyager 数据集与 Skyvern 的评测目录WebVoyager 是一类以真实线上网站为操作对象的智能体评测任务集每个 case 给出一条自然语言指令如在剑桥词典查询 sustainability 的发音和释义和对应的起始 URLAgent 需要在真实浏览器中完成多步操作并产出答案。本仓库在 evaluation/datasets 下维护了多份 WebVoyager 相关数据webvoyager_tasks.jsonl每行一个测试用例包含id如Cambridge Dictionary--0、起始站点web与问题queswebvoyager_reference_answer.json按站点组织的标准答案answers每个答案包含id与ans用于后续自动判定另有webvoyager_compute_use_tasks.jsonl、webvoyager_outdated_tasks.jsonl等衍生版本。数据装载逻辑位于 evaluation/core/utils.pyload_webvoyager_case_from_json逐行读取webvoyager_tasks.jsonl将Cambridge Dictionary--N形式的 id 拆分为站点名与序号再在参考答案 JSON 中按id匹配标准答案最终构造WebVoyagerTestCase字段含group_id、id、url、question、answer、is_updated、max_steps。从源码结构可以推断该评估体系以任务投递 → 浏览器自动执行 → 汇总结果 → LLM 断言为主线全部脚本集中在 evaluation/script 下。本次评估针对Cambridge Dictionary站点共 43 个任务id 255297覆盖单词发音/释义/例句查询、多语种翻译、Thesaurus 同义词、Grammar 语法知识、Plus 在线测验、官方 Shop 商品浏览以及首页语言切换等真实浏览场景是检验 Skyvern 在内容型信息网站上信息提取能力的典型样本。二、结果总览40 项通过3 项失败对 webvoyager-Cambridge-Dictionary.md 中 43 条记录逐行统计状态数量占比completed4093.0%failed36.9%合计43100%3 个失败任务分别是id268Find one word, one phase and one idiom related to euphoria无 summary / output未产出结果id274Try a Cambridge Dictionary translation and tell me which company provided the translation状态 failed但 summary 与 output 均有值输出{translation_provider: Zhu Zhu}说明任务执行到了最后一步但未通过判定id294Try the Word Scramble game in the Plus section无 summary / output未产出结果。值得注意的是失败场景集中在两类一类是需要跨页面关系型检索的任务找同族词/词族搭配另一类是 Plus 区域的交互式小游戏Word Scramble后者对点击、输入和时序操作的鲁棒性要求更高。其余绝大多数查词 → 提取 → 结构化输出类任务均一次通过说明 Skyvern 在结构化信息提取型网站上具备稳定的自动化能力。每条记录同时包含skyvern link可回溯到 eval.skyvern.com 的云端运行概览页与workflow_run_id如wr_348591137739312938便于逐条复盘浏览器轨迹。三、词汇查询与发音任务23 项全部通过单词查询是本评估集占比最大的任务类型要求 Agent 在词典词条页中提取释义definition、英美发音UK/US IPA 音标、例句example sentence部分任务还要求列出多个义项或统计义项数量。23 项词汇类任务全部 completed典型结构化输出如下。以 id 255sustainability为例最终 output 为{ word: sustainability, definition: the quality of being able to continue over a period of time: the long-term sustainability of the community; the quality of causing little or no damage to the environment and therefore able to continue for a long time: the companys commitment to environmental sustainability, pronunciation: {uk: /səˌsteɪ.nəˈbɪl.ə.ti/, us: /səˌsteɪ.nəˈbɪl.ə.t̬i/} }id 256serendipity则在发音与释义之外额外提取了示例句There is a real element of serendipity in archaeology.。id 263dog展示了多义项提取能力输出为三个含义的数组每个含义包含partOfSpeech、context如ANIMAL、PERSON (slang)、FOLLOW与examplesid 272unblemished则直接回答该词有几个释义并给出meanings_count: 2说明 Agent 能理解数数这类计数型指令。下表完整列出 23 项词汇类任务id、状态、问题与关键输出要点id状态问题关键输出要点255completedsustainability 的发音与释义双语义项 UK/US 音标256completedserendipity 的发音、释义与例句释义 例句archaeology 句257completedubiquitous 的 UK/US 发音、释义与例句释义seeming to be everywhere 10 条例句258completedzeitgeist 的释义、发音与例句UK/US 音标 15 条例句259completedinnovate 的英式 IPA 与一句例句ˈɪn.ə.veɪt 时尚行业句260completedprocrastination 的 UK/US 发音与例句UK/prəˌkræs.tɪˈneɪ.ʃən/、US/proʊˌkræs.tɪˈneɪ.ʃən/ 例句262completedgestalt 的释义、发音与例句UK/ɡəˈʃtælt/、US/ɡəˈʃtɑːlt/ 例句263completeddog 的三种不同含义3 个含义名词动物/俚语/动词跟随各带 context 与例句264completedeuphoria 的英式发音与例句/juːˈfɔː.ri.ə/ 获奖后例句265completedimpeccable 的释义、发音与例句释义 UK/US 音标 His English is impeccable.266completedameliorate 的发音、释义与例句释义 干旱援助例句267completedresilience 的发音、释义与例句释义 心理学例句269completedconcatenate 的发音、释义与例句释义 文件名例句270completedpandemic 的发音与例句UK/US 音标 疟疾例句271completedcryptocurrency 的释义、发音与两个例句长释义 British/American 音标 双例句272completedunblemished 有几个释义meanings_count: 2 两个释义与例句275completedaltruism 的释义、UK/US 发音与例句释义 音标 Shes not known for her altruism.277completedquintessential 的释义、UK 发音与例句释义 /ˌkwɪn.tɪˈsen.ʃəl/ 奶酪例句278completedmeticulous 的美式 IPA 与例句məˈtɪk.jə.ləs 研究例句279completedreverie 的释义、UK/US 发音与例句释义 双音标 走神例句280completedharmony 的两种不同含义MUSIC 义 MATCH 义各带 guideWord 与例句282completedsolitude 的释义、发音与例句释义 双音标 海上独处例句295completedmitigate 的释义、UK 发音与例句释义 /ˈmɪt.ɪ.ɡeɪt/ 旅游影响例句从这些输出可以归纳出 Agent 的稳定行为模式先搜索词条、进入对应语义块guideWord/context维度再把释义、音标、例句分别填入 JSON 字段遇到examples是数组型字段时能抓取多个句子而非只取一句如 id 257、258。这体现了 create_webvoyager_task_v2.py 中以TaskV2Request(url, user_prompt)直接驱动的任务执行链路对提取型目标的适配性。四、多语言翻译任务4 项Cambridge Dictionary 提供多语种互译评估集中有 4 个翻译相关任务id状态问题关键输出要点261completedsustainability 的中文与法文翻译中文繁体可持續性, 可持續性永續性、简体可持续性, 可持续性永续性、法文durabilité, viabilité276completedephemeral 的西班牙语翻译efímero, pasajero数组形式281completednostalgia 的中文翻译繁体對往事的懷念懷舊念舊、简体对往事的怀念怀旧念旧274failed尝试翻译功能并说明由哪家公司提供翻译输出{translation_provider: Zhu Zhu}但状态 failed其中 id 261 证明 Agent 能够同时提取目标语言 1的复合翻译中文繁简 法文id 276 将西班牙语翻译以数组[efímero, pasajero]呈现符合多义词翻译的表达习惯。id 274 属于特例Agent 已定位到 English–Chinese (Simplified) 词典页并在 Acknowledgements 区域找到译者署名 Zhu Zhu也产出了结构化输出却仍被判 failed——从评测脚本见第八节看failed既可能来自工作流未正常结束也可能来自答案与参考ans的 LLM 断言不一致这提示翻译类任务的判定标准比提取类更严格。五、Thesaurus 同义词检索2 项id状态问题关键输出要点273completed在 Thesaurus 中搜索 to behave well 并列出同义词[behave themselves, behave, be on their best behaviour]283completed在 Thesaurus 中搜索 feel giddy 并列出同义词[feel dizzy, whirl, spin, reel]且每个词带对应 thesaurus 页 URLid 283 的亮点在于不仅提取了同义词还保留了每个同义词的词典内链接如https://dictionary.cambridge.org/thesaurus/feel-dizzy说明 Agent 在抓取列表时同步捕获了锚点文本与 href具备富链接提取能力这类细节在构造知识图谱类应用时很有价值。六、Grammar 语法知识检索8 项全部通过Grammar 类任务要求进入剑桥词典的 Grammar 栏目并提取语法规则、句式与例句输出以规则数组形式组织信息密度高8 项全部 completedid语法主题输出结构要点285Present perfect simple分formhave/has -ed、uses、Recent completed events、Past events, present results、Time for and since、Yet、Already、Still、Introducing past time events、American English共 10 个 rule每个 rule 带肯定/否定/疑问例句并附extraction_metadatasource_url 与提取时间戳286情态动词表可能性might/could/may按三个情态动词分组分别给出 1030 条不等的真实例句287fewer 与 less 的区别4 组 context 例句 note如传统语法规则、of用法、省略名词288被动语态定义、主动/被动对比、例句含带 by 短语与不带施事者两种情况289比较级与最高级形容词2 条 rule每条含例句与高亮词如more expensive、the slowest290多词介词7 个多词介词in addition to、in front of、in spite of and despite、by the time、look up to、look forward to、for -ing各带定义/例句/补充说明另附介词短语结构说明291间接引语陈述句/疑问句/命令句的转换示例附时态变化表、情态动词变化表、代词与副词变化示例292冠词 a/an/the3 个冠词各带说明与例句附可数/不可数名词、发音规则/ðiː/ vs /ðə/、特例the sun、the rich、go to work 等与常见错误以 id 285 为例Agent 甚至从语法页面提取了That house on the corner has been empty for three years.与...since 2006.这类同义时态对照例句说明它对页面中for/since 对照讲解块有结构化理解。这类任务的共同特征是目标页面不是词条页而是 Grammar 长文页输出需要按小节切分——Agent 能稳定完成长文本分块提取与词汇类任务一样保持了 JSON Schema 一致性。七、Plus 测验、Shop 浏览与语言切换Cambridge Dictionary 的特色功能区同样被纳入评估考察 Agent 的多步交互与跨页操作能力id状态任务关键输出要点284completed进入 Plus 的 Image quizzes完成一局 Animals 简单测验并报告得分{quiz_category: Animals, quiz_difficulty: Easy, final_score: 3, total_questions: 6}293completed进入 Plus免登录完成一局推荐 Grammar 测验并报告得分主题-ed and -ing adjectives满分12/12且逐题输出答案数组每题answercorrect: True296completed浏览官方 Shop 区块并列出 3 件商品3 件 Word of the Year 2024 周边T 恤 £20、笔记本 £15、连帽衫 £48含名称、价格、图片 URL297completed将首页从 English (UK) 切换为 Deutsch输出语言Deutsch、首页区块Wörterbuch/Übersetzen/Grammatik/Thesaurus/…、搜索框占位符与热门搜索词id 284 与 293 是真实交互 得分统计型任务Agent 需要进入测验、逐题作答、翻页到底再读取最终得分——id 293 甚至做到了 12/12 满分且把每题答案回传。id 297 则验证了多语言站点切换能力语言下拉选择并捕捉了切换后的界面文案与热门搜索列表。这些结果说明 Skyvern 不仅能做读页面也能执行点按钮、做选择、读结果的完整交互闭环。八、失败案例分析3 项失败的共性与启示3 个 failed 任务中2 个完全没有产出summary/output 均为 nan1 个有产出但未通过判定id 268找 euphoria 相关的 word/phrase/idiom这类同族关系检索需要先找到词条中的 Related words、Idioms and phrases 等侧栏区块再从中挑选恰好一个 word、一个 phrase、一个 idiom。若页面元素为 JS 动态折叠或侧栏与主内容不在同一 DOM 层级Agent 容易遗漏目标区块最终无输出。id 274翻译提供方输出已给出translation_provider: Zhu Zhu但被判 failed。从评测脚本 eval_webvoyager_task_v2.py 看failed的来源有二一是工作流未以completed结束二是工作流正常结束但eval_skyvern_workflow_run的 LLM 断言认为输出与参考答案不符。该任务要求用户尝试一次翻译再回答公司名Agent 可能只读了 Acknowledgements 而未真正触发一次翻译动作导致断言不过。id 294Word Scramble 拼字游戏交互式小游戏涉及字母点击、拖拽或键盘输入、倒计时与即时校验对操作时序要求苛刻Agent 未能在步数上限内完成无输出。这三个失败点对工程实践有直接启示在构造面向交互游戏/动态内容的任务时应适当放宽max_stepsWebVoyagerTestCase中预留了max_steps字段evaluation/core/utils.py并建议在评估指标中同时记录已产出但断言失败与完全无产出两种失败子类便于针对性优化。九、评测流水线源码解析从投递到判定的完整链路围绕本次评估仓库提供了两套可复现的流水线均基于 evaluation/core/init.py 中的SkyvernClient与Evaluator链路 ATask V2Observer 巡航投递 拉取结果create_webvoyager_task_v2.pystart_forge_app()启动 Forge 应用逐 case 调用load_webvoyager_case_from_json(evaluation/datasets/webvoyager_tasks.jsonl, group_id...)装载数据用prompt_engine.load_prompt(check-evaluation-goal, user_goal..., local_datetime...)让 LLM 对原始指令做目标澄清/改写改写前后不同则置is_updatedTrue此机制让指令更贴近可执行粒度构造TaskV2Request(urlcase_data.url, user_promptcase_data.question)经Evaluator.queue_skyvern_task_v2提交为 Observer Cruise将返回的task_v2_id、workflow_run_id、workflow_permanent_id、cruise_url写回记录文件。链路 BWorkflow 投递create_webvoyager_workflow.py逻辑与 A 相同但以WorkflowRequestBody(data{url, instruction, answer}, proxy_location...)的形式把标准答案一并注入工作流参数并支持通过--proxy-location覆盖代理位置适用于需要指定地区出口的场景。结果回捞与断言eval_webvoyager_task_v2.py按BATCH_SIZE 5并发调用get_workflow_run拉取状态、summary、output状态非completed时直接置assertionFalse并记录failure_reason状态为completed时调用Evaluator.eval_skyvern_workflow_runevaluation/core/init.py把question、answer、is_updated交给 LLM 进行输出 vs 参考答案判定任何异常同样落为失败逐条写入 CSV表头为id, status, assertion, failure_reason, url, question, answer, summary, output, is_updated, workflow_permanent_id, workflow_run_id。另有 create_webvoyager_evaluation_result.py 提供只回捞结果、不重新断言的轻量导出assertion直接取status completed适合对历史运行记录做汇总。客户端层面SkyvernClientevaluation/core/init.py统一以x-api-key头完成鉴权max_steps通过x-max-steps-override请求头透传Task V2 走/api/v2/tasksWorkflow 走/api/v1/workflows/{workflow_pid}/run/。这就是本评估结果文件中每行workflow_run_id与结构化 output 的来源。十、如何在本仓库复现这套评估本仓库为只读状态以下命令用于在你自己的部署环境中运行评估涉及启动 Forge 与访问 Skyvern API需预先准备base_url与组织凭据cred先创建 Task V2 巡航并生成记录文件python evaluation/script/create_webvoyager_task_v2.py --base-url https://your-skyvern-host/api/v1 --cred YOUR_API_KEY运行结果回捞与自动断言输出output.csvpython evaluation/script/eval_webvoyager_task_v2.py \ --base-url https://your-skyvern-host/api/v1 \ --cred YOUR_API_KEY \ --record-json 上一步生成的-webvoyager-record.jsonl \ --output-path output.csv若走 Workflow 链路先建好 WebVoyager 工作流并取得workflow_pid然后python evaluation/script/create_webvoyager_workflow.py \ --base-url https://your-skyvern-host/api/v1 \ --cred YOUR_API_KEY \ --workflow-pid YOUR_WORKFLOW_PID [--proxy-location RESIDENTIAL]数据集与参考答案分别位于 evaluation/datasets/webvoyager_tasks.jsonl 与 evaluation/datasets/webvoyager_reference_answer.json可对照修改以扩充测试集结果文件按站点归档在 evaluation/results除本次的 Cambridge Dictionary 外还有 Amazon、Booking、Google Flights、Wolfram Alpha 等站点结果可供横向对比。小结Cambridge Dictionary 的 43 项评估是 Skyvern 在信息检索型真实网站上的高质量样本——93% 的通过率覆盖了查词、翻译、同义词、语法、测验与界面操作等丰富场景结构化输出稳定失败案例也清晰指向了交互型与关系型任务的改进空间。结合 evaluation 目录下公开的数据集与脚本这套评测可以低成本复用于任意网站为 Agent 能力迭代提供可量化的标尺。【免费下载链接】skyvernAutomate browser based workflows with AI项目地址: https://gitcode.com/GitHub_Trending/sk/skyvern创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考