8 月 10 日当周,三大科技公司同步发布针对 AI 代理的专用工具。阿里巴巴推出 MerchantBench——一个模拟 365 天电商业务运营的基准测试,使用超过 98,000 笔真实商品记录与 26 种工具评估 AI 代理的长期业务决策能力;测试结果显示,表现最佳的 LLM 仅达到人工经营者净资产的 27.3%。
阿里巴巴 MerchantBench:365 天电商模拟,最佳 AI 代理仅达人工经营者 27.3%
MerchantBench 是阿里巴巴推出的电商业务长期管理基准测试,模拟 365 天的完整业务运营;使用超过 98,000 笔真实商品记录与 26 种业务决策工具,测试 AI 代理在定价、库存管理、现金流等方面的表现如下:
测试周期:模拟 365 天电商业务运营
数据规模:超过 98,000 笔真实商品记录
工具数量:26 种业务决策工具
测试维度:定价、库存管理、现金流及其他商业决策
结果:表现最佳的 LLM 仅达到人工经营者净资产的 27.3%
与短期基准测试不同,MerchantBench 专注于长期决策,因为早期错误可能在后期造成复合影响。此基准测试提供了衡量 AI 代理能否长期维持绩效、适应市场变化并作出合理财务决策的方法。
Cloudflare Kitesurf:代理优先浏览器,CPU 与内存远低于 Chromium
Cloudflare 推出的 Kitesurf 是专为 AI 工作负载设计的代理优先浏览器,在 Cloudflare Workers 的隔离 V8 环境中运行。与传统为人类用户设计的浏览器不同,Kitesurf 优先考虑 AI 代理的需求:可扩展性、结构化内容、性能与更低的资源占用。
对于截图和 HTML 提取等常见任务,Kitesurf 的 CPU 和内存占用远低于 Chromium,适合同时运行多个浏览器代理。Kitesurf 已通过超过 215,000 项 Web 平台测试,支持 Puppeteer、Playwright 和基于 MCP 的 AI 代理工具;目前处于 Beta 测试阶段,Cloudflare 计划未来将其开源。
微软研究院 Flint:开源可视化语言,支持 50 种图表类型
微软研究院推出 Flint,这是一种开源可视化语言,让 AI 代理使用简洁易读的规范(而非复杂的坐标轴、刻度、间距和布局配置)生成图表;其编译器自动处理底层细节,支持 Vega-Lite、ECharts、Chart.js、Plotly 及原生 Excel 图表等多个渲染平台。
Flint 支持 50 种图表类型,并提供用于代理工作流的 MCP 服务器;通过减少 AI 模型需要生成的代码量,提高图表创建的可靠性并降低出错率。
Flint 为开发者提供跨不同渲染系统构建可视化图表的通用接口,对于需要动态生成图表的 AI 分析工具和数据代理尤其实用。
常见问题
阿里巴巴 MerchantBench 测试的结果是什么?
根据阿里巴巴的测试,在模拟 365 天电商业务运营(使用超过 98,000 笔真实商品记录和 26 种工具)后,表现最佳的 LLM 仅达到人工经营者净资产的 27.3%,凸显 AI 代理在独立管理复杂业务方面仍有较大改善空间。
Cloudflare Kitesurf 目前是否可以使用?
根据文章说明,Kitesurf 目前处于 Beta 测试阶段,已通过超过 215,000 项 Web 平台测试;Cloudflare 计划未来将其开源。Kitesurf 支持 Puppeteer、Playwright 和基于 MCP 的 AI 代理工具。
微软 Flint 支持哪些图表渲染后端?
根据微软研究院说明,Flint 支持 Vega-Lite、ECharts、Chart.js、Plotly 及原生 Excel 图表等多个渲染平台,共支持 50 种图表类型,并提供用于代理工作流的 MCP 服务器。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复