最近,全球权威AI智能体测试基准“OSWorld”公布最新排名,由中国AI团队研发的智能体产品“实在Agent”以90.2%的成功率位列全球总榜首位,同时斩获Agentic Framework分榜第一,实现双项冠军。这是该测试自2024年设立以来,全球智能体首次突破90%大关,此前最高纪录由Meta、OpenAI、Anthropic等海外科技企业保持。而这个AI团队就来自杭州。“OSWorld”的特别之处在于,它不考察语言对话的流畅度,而是把AI直接放进真实的电脑操作系统,要求其独立完成文件编辑、表格处理、图像修改、邮件收发、跨应用协同等361项复杂任务。全程由机器自动判定结果,没有任何人为打分的主观空间。你可以把它理解为让AI像真人一样,打开电脑把活儿干了。正因为贴近真实办公场景,OSWorld自2024年由香港大学、卡内基梅隆大学、滑铁卢大学等学者联合发起后,迅速被视为衡量AI“计算机操作能力”的权威标尺。而它的难度曲线也相当陡峭:2024年刚推出时,GPT-4o、Claude等顶级模型成功率仅12%;2025年年底,行业最好成绩提升到72.6%,首次超过人类平均水平;今年5月,纪录被推至83.6%。不过“实在Agent”交出了90.2%的答卷。在图像处理(GIMP)、跨应用协同、多软件联动这些公认的高难度任务上,它表现尤为突出;系统底层操作类任务更是拿下满分。业内人士分析,跨应用考验的是长链路规划能力,图像处理反映的是非标准界面的视觉理解深度,而系统级零失误则体现了执行闭环的稳定性——三者叠加,构成了难以复制的综合优势。“实在Agent”出自杭州实在智能科技有限公司,2018年成立,核心团队约半数成员来自阿里巴巴,以及百度、腾讯、美团点评、网易、搜狐等一线互联网企业。创始人孙林君,原阿里巴巴资深算法专家,在阿里近十年间主导搭建了支撑花呗、借呗等产品的诚信模型体系。8年前,他结束了在阿里10年算法工程师的身份,创办了“实在智能”,投身人工智能的星辰大海。短短几年时间将实在智能做成了国内头部的机器人流程自动化服务商。刚创业时,AI行业还没有迎来大模型的爆发。实在智能避开了参数竞赛的虚火,沉入企业级服务场景。2023年,大模型风口骤起,实在智能推出了全球首款通用智能体产品“实在Agent”。支撑这一节点的,是八年间在真实办公场景中积累的海量操作数据和工程经验。团队的核心判断是:智能体能力不只看底层大模型的“智力”水平,更依赖整套工程调度系统的可靠性。他们做了一个形象的类比——大模型是发动机,但光有马力不够,方向盘、制动系统、底盘调校同样决定一辆车能开多远。这套被称作Harness的工程调度系统,正是实在智能7年企业服务中反复打磨的核心能力。
网站声明:
本文仅代表作者个人观点,与新江南网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,新江南网号系信息发布平台,新江南网仅提供信息存储空间服务。如有侵权请出示权属凭证联系管理员(yin040310@sina.com)删除!