Google正式推出可在Chrome浏览器中直接执行网页任务的AI代理Gemini Spark,进一步将生成式AI能力从“回答问题”拓展到“代为操作”。这一功能可处理比价、预约、表单填写等重复性网页操作,显示出Google正试图借助“行动型AI”重塑Chrome在日常上网场景中的角色。
据TechRadar当地时间8月5日报道,Google已面向Chrome引入Gemini Spark。与以信息检索和问答为主的Gemini不同,Gemini Spark的核心变化在于它可以直接操作浏览器,在多个网页之间切换并完成指定任务。
具体来看,用户可在Chrome顶部的“Ask Gemini”面板中输入指令。Gemini Spark会先展示执行计划,随后申请相应的浏览器操作权限;在获得授权后,便可自动访问网站并执行比价、预约、填写表单等操作。Google表示,即使用户在任务开始后关闭浏览器窗口,相关流程仍可在后台继续执行。
不过,这项功能目前的使用条件并不低。用户需使用Windows 11或macOS设备,安装最新版Chrome,登录个人Google账号,并订阅Google AI Pro或Google AI Ultra;同时,Chrome的安全浏览还需设置为“标准保护”或“增强保护”。完成上述条件后,用户还需在Chrome的AI设置中启用“Let Gemini browse for you”选项。
从适用场景看,Gemini Spark主要面向重复性网页任务。例如,用户如果要求其在Amazon、Best Buy、Costco和Walmart之间比较65英寸电视价格,并结合优惠码筛选最低价格,Gemini Spark就会自动访问相关电商平台,比较商品价格和促销信息,并将流程推进至支付前一步。
但涉及资金交易时,系统不会自动完成付款。Google表示,在支付等关键环节,Gemini Spark将暂停操作,并强制要求用户进行确认。
除购物外,该功能也可用于预约类事务。比如,用户如果提出为“两名成人和两名儿童”的家庭出行安排行程,Gemini Spark可结合营业时间和交通路线进行规划,并把餐厅订位、博物馆门票购买等流程推进至最终确认步骤。
在表单填写方面,Gemini Spark同样支持自动处理。以申请图书馆会员证为例,它可以调用用户已保存的地址和联系方式自动填写申请表,但最终提交仍需由用户手动完成。Google认为,这项能力在调用Google账号中已保存信息完成资料填写方面具备便利性。
Google称,上述确认机制旨在兼顾自动化与安全性。对于购买行为或涉及敏感个人信息填写的关键步骤,AI不得擅自完成,必须经过用户核验。TechRadar评价称,这体现了“实用自动化”与“基本安全护栏”之间的平衡。
业内也有观点认为,Gemini Spark反映出Google AI战略的进一步转向。过去,生成式AI更多用于答疑或解释操作流程;如今,Gemini Spark已更进一步,开始直接在浏览器中代替用户完成任务,朝“Agentic AI”方向演进。
随着AI代理直接集成进Chrome,Google试图以AI重塑搜索、购物、预约和资料填写等浏览器内日常操作的意图也愈发清晰。不过,现阶段该功能仍需满足系统版本、Chrome版本、付费订阅和安全设置等多项条件,初期可使用的人群相对有限。
即便如此,Gemini Spark仍被视为一个具有代表性的案例:浏览器正从单纯的上网工具,逐步演变为可直接执行事务的AI平台。