构建韩语Web智能体广度搜索基准Ko-WideSearch:挑战、设计与评估
1. 项目背景与核心问题为什么需要一个韩语广度搜索基准在Web智能体Web Agents的研究与开发领域评估其能力一直是个老大难问题。我们经常看到智能体在特定任务上表现惊艳比如精准地填写一个表单或者从某个固定结构的页面里提取信息。但一旦把它扔到一个开放、动态、信息量巨大的真实网页环境中让它去“大海捞针”——比如找出某个电商网站上所有符合特定模糊描述的商品或者在一个大型论坛里枚举出所有讨论某个话题的帖子——它的表现往往就一言难尽了。这种任务我们称之为“穷举集合枚举”Exhaustive Set Enumeration它要求智能体具备强大的广度搜索能力。广度搜索不是简单地点击一个“下一页”按钮。它涉及到理解复杂的网站导航结构比如面包屑导航、侧边栏分类、标签云、处理分页机制可能是传统页码也可能是“加载更多”的无限滚动、识别并过滤重复或无关的结果以及最关键的一步判断搜索何时才算真正“穷尽”。一个合格的Web智能体不能在第一页就宣布任务完成也不能陷入无限循环不停地点击同一个“下一页”链接。那么如何科学地衡量一个Web智能体在这类任务上的能力呢这就需要一套精心设计的基准测试Benchmark。现有的基准测试如WebArena、Mind2Web等虽然覆盖了丰富的任务类型但在针对“韩语”环境下的“广度搜索”这一细分且关键的能力评估上存在明显不足。这就是“Ko-WideSearch”诞生的背景。它不是一个通用的Web智能体测试集而是一个专门针对韩语网站以穷举式集合枚举为核心评估目标的基准。我参与过多个多语言Web自动化项目深知语言环境带来的挑战远不止是字符编码。韩语网站有其独特的UI设计模式、信息组织逻辑和交互习惯。例如韩语中大量使用缩略语和合成新词导航菜单的结构可能更层级化分页控件的设计也可能与英语网站不同。一个在英文网站上训练或测试表现良好的智能体直接迁移到韩语环境很可能因为无法正确解析这些本地化特征而“翻车”。Ko-WideSearch正是要填补这一空白为研究和开发能够真正理解并操作韩语网站的智能体提供一个可靠、公平的“考场”。2. Ko-WideSearch基准的设计哲学与核心构成设计一个优秀的基准尤其是针对Web交互这种动态、高维的任务其难度不亚于开发智能体本身。Ko-WideSearch的设计遵循了几个核心原则这些原则也是我们在实际评估工作中总结出的血泪教训。2.1 真实性原则模拟真实用户的搜索路径基准中的任务场景必须来源于真实的韩语网站和用户需求。Ko-WideSearch不会去构造一些理论上存在但实际无人使用的页面结构。它的任务可能包括电商场景在韩国主流电商平台如Gmarket、11번가上找出“所有价格在5万韩元以下、带有无线充电功能的蓝牙耳机”。社区论坛在Naver Cafe或Daum Cafe的某个特定板块中枚举“过去一个月内所有包含‘맛집’美食店关键词的帖子”。新闻门户在Naver新闻或Daum新闻的特定分类下找出“本周所有与‘인공지능’人工智能相关的报道”。这些任务的定义本身就包含了模糊性如“本周”、“无线充电功能”需要智能体理解商品规格文本和结构性挑战需要遍历多个分类页面或处理复杂筛选器。2.2 可评估性原则明确的任务终点与评估指标“穷举”是核心但如何定义“穷举”Ko-WideSearch为每个任务预先定义了一个“标准答案集合”。这个集合是通过人工或半自动方式在特定时间点对目标网站进行彻底爬取和标注得到的。智能体在任务执行过程中发现的所有项目最终会与这个标准答案集进行比对。评估指标也围绕“穷举”和“效率”展开召回率智能体找到的项目数 / 标准答案集合总数。这是最核心的指标直接衡量搜索的“广度”和“彻底性”。理想情况下应为100%。精确率智能体找到的正确项目数 / 智能体找到的所有项目数。衡量搜索的“准确性”避免滥竽充数。操作步骤数智能体为完成任务所执行的操作如点击、输入、滚动总数。在召回率相近的情况下步骤越少说明智能体的搜索策略越高效。任务完成时间从任务开始到智能体主动终止或超时所经过的时间。覆盖深度智能体访问的唯一URL数量或页面深度。这反映了智能体探索网站结构的广度。2.3 多样性原则覆盖不同的网站类型与交互模式为了全面评估智能体Ko-WideSearch包含了多种类型的韩语网站静态内容主导型如企业官网、百科导航结构相对固定。动态交互密集型如电商、社交论坛大量使用JavaScript生成内容依赖用户交互点击筛选、加载更多。混合型如新闻门户既有静态导航栏又有动态更新的信息流。每种类型都对智能体的HTML解析能力、JavaScript执行状态判断和交互逻辑提出了不同挑战。2.4 技术实现框架一个基准不仅仅是任务描述还需要一套运行和评估的框架。Ko-WideSearch基准套件通常包含以下组件任务定义文件以结构化数据如JSON描述每个任务包括起始URL、任务的自然语言描述、标准答案集合或获取答案的验证接口、允许的操作空间如哪些按钮可以点哪些输入框可以填。环境模拟器一个可控的Web浏览器环境可能基于Playwright或Selenium封装用于执行智能体的操作。它需要能够处理韩语页面的渲染并记录所有交互。评估器根据智能体的执行轨迹和最终输出自动计算上述各项指标。基线智能体提供一些简单的基线方法例如基于规则的遍历器、或微调过的开源VLM视觉-语言模型智能体让研究者有一个对比的起点。3. 构建基准的关键挑战与解决方案构建Ko-WideSearch的过程本身就是一个极具挑战性的研究项目。以下几个坑是我们早期版本踩过并且认为任何想构建类似基准的团队都需要重点关注的。3.1 标准答案集的获取与维护这是最大的挑战。网站内容是动态变化的今天爬取的标准答案明天可能就因为商品下架、帖子删除而失效。Ko-WideSearch采用了一种混合策略快照与实时验证结合对每个任务网站在基准发布时保存一个静态快照如WARC格式确保标准答案在快照环境中是永恒有效的。同时提供一个可选的“实时验证模式”通过调用网站公开API或设计稳健的解析器在评估时动态获取当前的标准答案集用于评估智能体在真实动态环境下的表现。这相当于提供了“离线考题”和“在线随堂测”两种模式。答案的模糊匹配对于新闻标题、帖子内容等文本完全一致的字符串匹配过于严苛。Ko-WideSearch引入了基于韩语分词和语义相似度的模糊匹配机制。例如使用MeCab-ko进行分词后计算词袋模型或嵌入向量的相似度设定一个阈值来判断智能体找到的条目是否与标准答案对应。3.2 对“智能体作弊”的防范智能体特别是基于大语言模型LLM的智能体可能会利用训练数据中的记忆来“猜”答案而不是真正执行搜索。例如如果任务是在知名电商找某热门商品模型可能直接“幻想”出答案列表。Ko-WideSearch设计了多种机制来防止这种作弊引入对抗性任务创建一些需要依赖页面特定视觉布局或临时状态才能完成的任务。例如“找出本页面右侧边栏第二个推广模块中的产品”。这种任务无法仅凭先验知识完成。动态扰动在环境模拟器中对页面的非关键元素如CSS类名、部分无关的div的id进行随机化处理。这样智能体无法依赖固定的HTML路径来定位元素必须真正理解语义。任务描述的多样性同一个搜索意图用多种不同的自然语言句式来描述减少模型对固定任务模板的过拟合。3.3 处理韩语特有的语言与交互问题这是Ko-WideSearch区别于其他通用基准的核心。我们遇到了几个典型问题形态素变化与分词韩语是黏着语动词和形容词的词尾变化极其丰富。搜索关键词“맛집”美食店在帖子内容中可能以“맛집을”, “맛집에”, “맛집의”等多种形式出现。智能体的文本理解模块必须集成优秀的韩语分词器如OKT, Komoran或者使用对韩语形态学变化鲁棒性强的多语言嵌入模型如XLM-Roberta。编码与字体渲染确保Web环境模拟器正确支持UTF-8编码并能渲染韩语特有字体。有时页面会使用font-face加载自定义字体如果环境缺失字体可能导致文本提取为乱码或空白进而使智能体“失明”。本地化UI模式例如韩国网站流行使用“더보기”查看更多按钮来实现无限滚动其JavaScript触发逻辑可能与西方的“Load More”有细微差别。分页器可能同时提供“페이지”页面跳转和“다음”下一页按钮智能体需要理解两者的区别和适用场景。4. 基于Ko-WideSearch评估典型Web智能体架构有了基准我们就可以用它来“拷问”现有的Web智能体架构。这里分析几种主流架构在Ko-WideSearch任务上可能暴露的短板。4.1 基于纯文本LLM的智能体如使用HTML简化器这类智能体将网页HTML简化成纯文本或结构化文本如简化HTML然后交给LLM如GPT-4来理解和规划下一步操作。优势对自然语言任务理解能力强能处理模糊指令。在Ko-WideSearch上的挑战信息丢失简化HTML的过程可能丢失关键的视觉布局信息。在广度搜索中“页面底部”、“侧边栏”这些空间位置线索对于定位分页或筛选控件至关重要。规模不经济面对一个包含上百个商品列表项的页面将整个简化后的HTML可能长达数万token送入LLM成本极高且效率低下。LLM需要从中识别出“下一页”按钮和所有商品条目负担很重。状态跟踪困难遍历多页时LLM需要自己维护“已看过的页面”和“已收集的商品”等状态容易出错或遗忘导致重复收集或提前终止。4.2 基于视觉-语言模型VLM的智能体这类智能体直接对网页截图进行分析通过视觉特征来理解页面并定位可交互元素。优势能保留完整的视觉布局信息更接近人类浏览网页的方式。在Ko-WideSearch上的挑战文本识别精度特别是对韩语文本的OCR识别精度。如果“다음 페이지”下一页被错误识别为“다음 페이지”智能体可能就无法操作。这要求VLM必须具备强大的多语言文本识别能力。动态内容处理对于无限滚动加载的内容VLM需要判断何时页面已滚动到底部。这可能需要结合对滚动条位置的视觉判断和DOM分析复杂度较高。计算开销对每一页都进行截图和VLM推理比处理文本DOM的成本更高。4.3 混合架构智能体文本视觉专用模块这是目前看来最有希望应对Ko-WideSearch挑战的方向。一个典型的混合架构可能包括导航与结构理解模块专门分析页面DOM树快速识别出导航栏、分页器、筛选面板、主内容区等宏观结构。这个模块可以基于规则或轻量级模型快速缩小交互范围。内容提取与去重模块负责从主内容区如商品列表中提取结构化条目如标题、价格、图片并进行实时去重。这个模块需要集成韩语分词和相似度计算。LLM/VLM作为决策核心将导航模块提供的候选操作如“点击筛选-价格从低到高”、“点击下一页”和内容模块提供的当前状态“已收集50个不重复商品最新商品ID是XXX”以摘要形式提交给LLM/VLM由它做出高层决策“继续点击下一页”或“应用价格筛选”。状态管理器显式地维护任务状态包括已访问URL集合、已收集条目集合、当前筛选条件等。在Ko-WideSearch上这种架构的优势在于专用模块高效处理重复性、结构化的任务找分页按钮、提取商品信息LLM专注于处理异常情况和高级策略如“当前页面商品已重复是否意味着搜索已穷尽”分工明确效率和鲁棒性更高。5. 从Ko-WideSearch看Web智能体的未来发展方向通过对Ko-WideSearch基准的构建和使用我们可以清晰地看到当前Web智能体的能力边界也能窥见未来需要突破的几个关键方向。5.1 对“网站方言”的通用理解能力就像人类能快速适应不同网站的设计风格一样下一代Web智能体需要具备对“网站方言”的快速学习能力。这不仅仅是识别按钮上的文字是“Next”还是“다음”更是理解整个网站的信息架构模式。例如电商网站的“筛选-排序-列表”模式论坛的“版块-帖子列表-分页”模式。智能体需要能从少数几个页面的交互中归纳出当前网站的“模式”并应用到后续的广度搜索中。这需要模型具备更强的小样本归纳和迁移学习能力。5.2 搜索策略的主动学习与优化目前的智能体大多是被动执行搜索指令。未来的智能体应该能主动优化搜索策略。例如在Ko-WideSearch的电商任务中智能体应该能判断是先按价格排序再遍历还是先遍历所有页面再在本地排序前者可能更快达到价格筛选条件但可能因为排序机制丢失一些条目后者更彻底但更慢。智能体需要能根据任务目标召回率优先还是效率优先和网站特性动态选择或混合策略。这涉及到在线学习和强化学习在Web交互场景中的应用。5.3 跨语言与跨文化泛化Ko-WideSearch聚焦韩语但真正的挑战在于构建一个能快速适应任何新语言网站的智能体。这要求模型的底层表征对语言和文化差异是鲁棒的。一个可行的路径是加强多模态预训练让模型在大量多语言、多文化的网页截图和HTML数据上进行预训练学习将视觉布局、文本语义和交互元素关联起来而不依赖于特定语言的表面形式。5.4 基准本身的进化从静态评估到动态博弈当前的基准更像是“开卷考试”任务和答案是固定的。未来的基准可能会向“动态博弈”方向发展。例如基准环境可以模拟一个不断微调UI的网站今天分页在底部明天改到顶部或者引入“反爬虫”机制如验证码、请求频率限制来测试智能体的适应性和鲁棒性。这更能模拟真实互联网环境的复杂性。构建和使用Ko-WideSearch这类基准其价值远不止于给智能体打个分数。它更像一面镜子清晰地照出了我们当前技术路线的优势与盲区。每一次在基准测试中的失败都指向一个具体的研究问题每一次性能的提升都意味着智能体向真正的“通用网页操作者”迈近了一步。对于任何致力于开发实用化Web智能体的团队来说深入参与这样的基准构建、测试与迭代是获得深刻洞见、避开纸上谈兵陷阱的最有效途径。