发布日期:2026-08-02 18:51 点击次数:132
这项由蚂围聚团东谈主工智能团队完成的筹商发表于2025年8月,筹商团队包括顾章轩、曾正文、许震宇等多位筹商东谈主员。论文标题为"UI-Venus Technical Report: Building High-performance UI Agents with RFT",成心思深入了解的读者不错通过GitHub代码仓库(https://GitHub.com/antgroup/UI-Venus)获取更多期间细节。
遐想一下,你正在教一个从未见过电脑的一又友如何使用手机愚弄。你需要告诉他"点击这个蓝色按钮"、"滑动到页面底部"、"输入你的用户名"等等。目下,蚂围聚团的筹商团队作念了一件愈加令东谈主咋舌的事情:他们教会了东谈主工智能如何像东谈主相同"看懂"屏幕上的内容,况且大略准确地扩充各式操作任务。
这便是UI-Venus名目的中枢所在。UI在这里指的是用户界面,也便是咱们每天在手机、电脑上看到的各式按钮、图标、笔墨框等元素。而Venus这个名字则寓意着这个AI系统大略像维纳斯相同优雅地处理复杂的界面操作任务。
张开剩余92%传统的AI助手泛泛需要特意的愚弄程序接口才气与软件交互,就像需要特等的钥匙才气翻开特定的门。但UI-Venus透澈不同,它只需要"看"一张屏幕截图,就能结伙界面上的各式元素,并准确扩充用户的领导。这就好比一个东谈主第一次使用某个愚弄,天然不熟悉,但凭借对界面设计知识的结伙,依然大略找到正确的按钮并完成任务。
在期间杀青上,筹商团队面对的最大挑战是如何让AI信得过"结伙"屏幕上看到的内容。这不单是是识别笔墨和图像那么精真金不怕火,更关节的是要结伙这些元素之间的关连,以及它们在通盘用户任务中的作用。比如,当用户说"帮我发送这条音书"时,AI需要大略识别出哪个是输入框、哪个是发送按钮,以及正确的操作律例。
为了处治这个问题,筹商团队斥地了一种全新的考试设施,叫作念强化微调。这个过程就像考试一个新职工相同:最初让AI不雅察大宗的操作示例,学习基本的界面知识;然后通过反复熟谙,让AI在实质任务中不停革新我方的阐扬。与传统的考试设施不同,强化微调大略让AI从诞妄中学习,渐渐掌捏愈加精确的操作手段。
UI-Venus的阐扬照实令东谈主印象深化。在圭臬的界面识别测试中,其7B参数版块在ScreenSpot-V2基准测试中达到了94.1%的准确率,72B参数版块更是达到了95.3%的准确率。这些数字意味着,在100次操作中,UI-Venus险些不错正确完成94到95次,这也曾接近东谈主类各人的水平。
更焦虑的是,UI-Venus不仅大略识别界面元素,还大略扩充复杂的多法子任务。在AndroidWorld这个在线测试平台上,筹商东谈主员让UI-Venus完成各式着实的手机操作任务,比如添加权衡东谈主、发送音书、搜索信息等。扫尾炫夸,72B版块的UI-Venus达到了65.9%的告捷率,这意味着它大略孤苦完成绝大多数日常的手机操作任务。
一、数据质料:打造AI的"眼睛"和"大脑"
就像磨真金不怕火一个孩子需要优质的课本相同,考试UI-Venus也需要高质料的数据。筹商团队发现,现存的开源UI数据存在严重的质料问题,节略40%的数据包含各式诞妄,比如按钮位置标记诞妄、操作描摹不准确等。这就像给学生提供了诞妄的教科书,不仅学不到正确的知识,还可能养成诞妄的民俗。
为了处治这个问题,筹商团队训诲了一套严格的数据清洗经过。他们最初统一了不同数据源的体式圭臬,就像把不同出书社的课本整理成统一的课程体系。然后,他们仔细查验每一条数据,修正位置偏移的诞妄,从新编写糊涂不清的操作描摹。这个过程天然耗时,但确保了考试数据的准确性。
最终,筹商团队从627k条原始数据中悉心筛选出107k条高质料的界面识别数据,以及350k条界面操作数据。这些数据遮掩了手机、电脑、网页等各式界面类型,为UI-Venus提供了丰富而准确的学习素材。
更预见的是,筹商团队还斥地了一套自动化的数据生成系统。这个系统大略让也曾考试好的UI-Venus在凭空环境中不停尝试各式操作,记录告捷的操作轨迹,然后将这些轨迹加入到考试数据中。这就像一个学生通过大宗熟谙,不停追念出新的解题设施,然后将这些设施共享给其他学生学习。
二、中枢期间:强化微调让AI学会从诞妄中成长
传统的AI考试设施就像填鸭式教授,径直告诉AI正确谜底是什么。但在界面操作这个范围,这种设施存在泄漏颓势。比如,当AI需重点击某个按钮时,传统设施会严格要求AI点击按钮的精确中心位置,如果稍有偏差就觉得是诞妄。但实质上,独一丝击在按钮范围内,操作便是告捷的。
强化微调的设施透澈不同。它更像是荧惑式教授,温煦的是操作扫尾而不是过程的每一个细节。当AI告捷完成一个操作时,系统会赐与奖励;当操作失败时,系统会提供反馈,匡助AI结伙那边出了问题。通过这种模式,AI大略渐渐学会生动处理各式情况,而不是僵硬地师法考试样本。
筹商团队设计了一套小巧的奖励机制。关于界面识别任务,如果AI大略准细目位到想法元素,就能获取满分奖励;如果位置稍有偏差但仍在可收受范围内,则获取部分奖励。关于复杂的界面操作任务,奖励机制会概述议论操作类型的正确性、坐标位置的准确性、以及输入内容的匹配度等多个方面。
这种考试设施的上风在于,它大略让AI学会处理着实宇宙中的各式变化和不细目性。比如,团结个功能的按钮在不同版块的愚弄中可能位置略有不同,或者界面可能因为屏幕尺寸的各异而有所休养。传统的考试设施很难顶住这些变化,但强化微调大略让AI具备更强的泛化才略。
三、翻新设施:自进化轨迹对皆与零碎行动增强
在复杂的界面操作任务中,AI需要记取之前扩充过的操作,这么才气制定合理的下一步筹商。这就像你在使用一个新的购物愚弄时,需要记取刚才点击了哪些页面,目下处于什么位置,接下来应该怎么操作才气完成购买。
筹商团队发现,现存的数据中,不同操作法子的推理过程时时作风不一致,有的详实有的简短,有的偏期间有的偏日常。这种不一致性会让AI在学习时产生困惑,就像一个学生同期使用几本作风迥异的教科书,很难酿成一致的知识体系。
为了处治这个问题,他们斥地了一种叫作念"自进化轨迹对皆"的期间。精真金不怕火来说,便是让AI在每轮考试后,从壮盛成扫数操作法子的推理过程,确保这些推理过程在作风和详实进程上保持一致。这就像一个作者在完成初稿后,从新梳理通盘故事的证明作风,确保重新到尾都保持统一的文风。
另一个焦虑翻新是"零碎行动增强"期间。在界面操作中,有些行动比较常见,比如点击和滑动,但有些行动相对冷落,比如长按或者调用系统功能。这种顽抗衡的散布会导致AI对常见行动过于熟悉,而对冷落行动掌捏不及。但在实质愚弄中,那些冷落行动时时是完成复杂任务的关节法子。
零碎行动增强期间通过止境温煦这些冷落行动,为它们创造更多的学习契机。具体设施是,当系统发现某个操作轨迹包含零碎行动时,会生成多个版块的考试样本,每个版块都有不同的高下文配景但最终都导向团结个零碎行动。这么,AI就大略在各式不同的情境下熟谙这些关节行动,大大进步掌捏进程。
四、执行考证:在多个基准测试中创造新记录
为了考证UI-Venus的实质才略,筹商团队在多个泰斗基准测试中进行了全面评估。这些测试就像是AI界的"高考",涵盖了界面识别和操作的各个方面。
在ScreenSpot-V2测试中,这个基准主要评估AI识别界面元素的准确性。UI-Venus的72B版块达到了95.3%的准确率,比拟之前的最好收货94.8%有了权贵进步。更令东谈主印象深化的是,即使是参数目更小的7B版块,也达到了94.1%的准确率,特出了好多参数目更大的竞争模子。
ScreenSpot-Pro测试愈加严格,它使用高分手率的专科软件界面,包括CAD设计软件、斥地器具、创意软件等。这些界面泛泛包含大宗小尺寸的图标和复杂的布局,对AI的视觉结伙才略坑诰了极高要求。在这个挑战性更强的测试中,UI-Venus-72B达到了61.9%的准确率,比拟之前的最好收货58.4%有了权贵进步。
止境值得一提的是在AndroidWorld的阐扬。这是一个在线测试平台,要求AI在着实的安卓系统环境中完成各式日常任务。与静态的图片识别不同,这个测试需要AI大略进行动态的多法子操作,处理各式突发情况和界面变化。UI-Venus-72B在这个极具挑战性的测试中达到了65.9%的告捷率,特出了之前64.2%的最好记录。
筹商团队还在多言语环境下测试了UI-Venus的才略。在CA-GUI这个汉文界面测试中,UI-Venus展现出了优秀的跨言语泛化才略。即使考试数据主如果英文界面,它依然大略很好地结伙汉文界面的布局和功能,这解释了UI-Venus学到的是更深层的界面结伙才略,而不单是是特定言语的模式操心。
五、期间细节:两个特意化版块各司其职
筹商团队收受了一个预见的设计霸术,将UI-Venus分为两个特意化的版块:UI-Venus-Ground专注于界面元素识别,UI-Venus-Navi专注于复杂的多法子操作任务。这种单干就像一个团队中有特意稳健不雅察的窥探员和稳健扩充的行动员,各自觉挥专长,提高合座遵守。
UI-Venus-Ground收受了"无想考"模式,径直输出想法元素的位置坐标,反应速率极快。这种设计得当需要快速反应的愚弄场景,比如及时的界面援救或自动化测试。比拟之下,UI-Venus-Navi收受了"有想考"模式,会先分析刻下情况,制定行动筹商,然后扩充具体操作。这种模式天然相对较慢,但大略处理愈加复杂的任务序列。
在奖励机制设计上,两个版块也有所不同。界面识别版块主要温煦位置准确性,使用精真金不怕火而有用的"点在框内"奖励机制。而导航操作版块则使用愈加复杂的多维度奖励系统,概述议论体式正确性、行动类型准确性、坐标精确性和内容匹配度等多个成分。
考试过程中,筹商团队使用了不同的超参数缔造来优化两个版块的性能。界面识别版块使用较高的学习率以快速敛迹,而导航操作版块则使用相对保守的缔造以确保踏实性。这种各异化的考试策略充分施展了每个版块的上风。
六、实质愚弄:展现着实场景下的高大才略
除了圭臬基准测试,筹商团队还展示了UI-Venus在实质愚弄场景中的阐扬。他们设计了一系列靠近着实使用情况的测试案例,涵盖了日常生存中常见的各式界面操作需求。
在一个典型的案例中,用户要求AI"在夸克浏览器中检察云图片中'壁纸_3.jpg'的详实信息"。这个任务需要AI结伙汉文领导,导航到正确的愚弄功能,使用搜索功能查找特定文献,然后索取并整理文献的详实信息。通盘过程波及7个连气儿的操作法子,每一步都需要基于前边法子的扫尾来决定下一步行动。
UI-Venus告捷完成了这个任务,不仅准确找到了想法文献,还正确索取了文献名、大小和ID等关节信息。更焦虑的是,通盘操作过程通顺天然,莫得出现卡顿或诞妄操作,展现出了接近东谈主类用户的操作体验。
在另一个测试案例中,AI需要在权衡东谈主愚弄中创建一个新的权衡东谈主,但明确要求"不要保存"。这个看似精真金不怕火的任求实质上测试了AI对领导细节的结伙才略和自我为止才略。UI-Venus准确结伙了用户的意图,完成了扫数信息输入法子,但最终莫得点击保存按钮,好意思满扩充了用户的要求。
这些实质愚弄案例解释,UI-Venus不仅在圭臬测试中阐扬优异,在着实使用场景中也能提供可靠的做事。它大略结伙复杂的用户领导,处理多法子的任务序列,甚而大略在必要时展现出自我料理才略。
七、期间挑战:冲破传统设施的局限性
斥地UI-Venus的过程中,筹商团队碰到了好多期间挑战,需要翻新性的处治决策。其中最大的挑战之一是如何让AI结伙界面元素之间的语义关连,而不单是是识别它们的视觉特征。
传统的狡计机视觉设施主要温煦图像中的像素模式,大略识别出按钮、文本框等界面元素,但很难结伙这些元素在用户任务中的作用。比如,天然AI大略识别出一个按钮,但不一定知谈这个按钮是用来提交表单、取消操作照旧翻开新页面的。
为了处治这个问题,筹商团队将视觉结伙与言语结伙赓续结,斥地出多模态的结伙机制。这种设施不仅分析界面的视觉布局,还议论按钮标签、高下文信息、以及用户领导等语义印迹。通过概述这些信息,AI大略更准确地结伙每个界面元素的功能和意图。
另一个焦虑挑战是处理界面的动态变化。当代愚弄的界面不时会笔据用户操作、集中景象、或其他成分发生变化。比如,一个购物愚弄的页面可能会笔据用户的浏览历史炫夸不同的商品保举,或者一个酬酢愚弄可能会笔据新音书的数目休养界面布局。
UI-Venus通过引入历史高下文机制来顶住这种动态性。它不仅分析刻下的界面景象,还会议论之前的操作历史和界面变化,从而更好地结伙刻下的情况和可能的下一步行动。这种设施让AI大略像东谈主类用户相同,笔据高下文信息作念出合理的判断。
八、性能优化:在精度和遵守之间找到均衡
在实质部署中,UI-Venus需要在准确性和反应速率之间找到适合的均衡。关于不同的愚弄场景,用户对这两个方针的要求可能不同。比如,在自动化测试中,准确性是最焦虑的,稍慢一些的反应也不错收受;而在及时援救系统中,快速反应可能比好意思满的准确性更焦虑。
筹商团队通过多种模式优化了UI-Venus的性能。在模子架构层面,他们收受了高效的属意见机制,大略快速处理高分手率的界面图像。在考试策略上,他们使用了知识蒸馏期间,将大模子的才略蜕变到小模子中,在保持较高准确性的同期权贵进步了推理速率。
此外,筹商团队还斥地了动态休养机制,大略笔据任务的复杂进程自动采纳合适的处理策略。关于精真金不怕火的界面识别任务,系统会使用快速模式;关于复杂的多法子操作,系统会切换到精确模式。这种自适合的设施确保了在各式场景下的最好性能阐扬。
在内存和狡计资源的优化方面,筹商团队收受了梯度查验点、混杂精度考试等先进期间,大大裁汰了考试和推理的资源需求。这些优化让UI-Venus大略在相对有限的硬件环境中踏实运转,为实质部署创造了条目。
九、改日瞻望:不竭革新的发展所在
天然UI-Venus也曾取得了权贵的恶果,但筹商团队也明晰地意识到还有革新空间。他们在论文中坦诚地参谋了刻下系统的局限性,并坑诰了改日的发展所在。
一个焦虑的革新所在是处治AI推理过程中的"幻觉"问题。有期间,AI在想考阶段会产生正确的推理,但在扩充阶段却作念出了不一致的行动。这种想考与行动之间的不一致性可能会导致用户困惑,需要进一步的期间冲破来处治。
另一个发展所在是扩大考试数据的范围和各种性。天然刻下的考试数据也曾十分丰富,但筹商团队觉得,通过网罗更多着手的高质料数据,止境是不同文化配景和使用民俗的数据,大略进一步进步AI的泛化才略和适合性。
筹商团队还筹商探索愈加智能的预考试策略。他们觉得,就像东谈主类在学习使用新愚弄时会依赖以往的教会相同,AI也应该具备这种搬动学习的才略。通过在大范围、各种化的界面数据上进行预考试,AI可能大略更快地适合全新的愚弄和界面设计。
在愚弄层面,筹商团队遐想UI-Venus将来大略复旧愈加复杂的任务,比如跨愚弄的责任经过自动化、基于天然言语的个性化界面定制等。这些高档功能将进一步开释AI助手的后劲,为用户带来愈加方便和智能的体验。
说到底,UI-Venus代表了东谈主机交互范围的一个焦虑跨越。它不仅展示了刻下AI期间在界面结伙和操作方面的才略上限,也为改日愈加智能和天然的东谈主机交互模式指明了所在。跟着期间的不停老练和完善,咱们成心义期待,在不久的将来,AI助手将大略愈加无缝地融入咱们的数字生存,成为信得过意旨上的智能伙伴。
这项筹商的开源发布也体现了蚂围聚团对股东行业发展的喜悦。通过共享代码、数据和期间细节,他们为通盘筹商社区提供了难得的资源,必将促进更多翻新恶果的流露。关于成心思进一步了解期间细节的读者,不错看望名目的GitHub页面获取完整的杀青代码和执行数据。
Q&A
Q1:UI-Venus和以前的AI助手有什么区别?
A:UI-Venus最大的性情是只需要看屏幕截图就能结伙和操作界面,不需要特等的程序接口。以前AI助手泛泛需要斥地者特意为它们编写通顺程序,而UI-Venus就像东谈主类相同,看到界面就知谈该怎么操作,大略处理任何愚弄程序的界面。
Q2:UI-Venus能透澈替代东谈主工操作手机和电脑吗?
A:目下还不行透澈替代,但也曾大略处理大部分日常任务。在测试中,UI-Venus在安卓系统上的告捷率达到65.9%,这意味着它大略孤苦完成节略三分之二的常见操作任务。跟着期间不停革新,改日的告捷率还会进一步进步。
Q3:以前用户什么期间能用到UI-Venus期间?
A:天然筹商团队也曾开源了关联代码开云体育,但UI-Venus目下主要面向斥地者和筹商东谈主员。要让以前用户方便使用,还需要进一步的产物化斥地。不外,这项期间很可能会最初集成到各式自动化器具和援救软件中,巩固参加日常愚弄场景。
发布于:北京市Powered by 开云(中国)kaiyun网页版登录入口 @2013-2022 RSS地图 HTML地图
Copyright Powered by站群系统 © 2013-2024