
约书亚·斯坦克尔在洛杉矶经营着一家名为Clean Saint的公司,主营免水型口腔护理膜。这家公司实际上只有他一个人。他借助AI处理采购、营销、网站建设和客户服务等事务。当被问及对这种模式的感受时,他这样描述:“从某种意义上说,我现在仿佛拥有了十个分身。”
这句话的后半句耐人寻味:如果你真的拥有十个“分身”,就必须有办法确认另外九个“分身”到底有没有把工作做好。
目前,关于AI的讨论,大多仍聚焦于同一个问题:哪个模型最好?但对企业而言,这并不是合适的衡量标准。模型能做的是逻辑推理,而商业运作涉及给供应商打电话、报关、追查错过船期的集装箱、处理退货等具体环节,这些任务没有一项可以单凭模型独立完成。真正能够完成工作的是AI智能体,它由三部分组成:负责思考的模型;赋予其工具、记忆和行动能力的运行框架;以及让它明白“在特定行业中何为理想结果”的业务场景。在阿里国际站,这种场景认知,源自27年来对全球贸易实际运转的持续沉淀。
真实商业场景对AI智能体提出了哪些要求
如今,AI行业已经非常擅长评估模型的智能水平。各类基准测试涵盖了推理、编程、数学、事实检索,并逐渐延伸至工具调用能力。然而,现实中的商业运作远比这些基准测试所反映的情况繁复得多。单看书面流程,采购任务似乎很简单,但在实际操作中,可能意味着要横向对比数十份报价,找出产品规格书第四页隐藏的前后矛盾之处,仔细审查付款条款,以察觉其中悄然发生的变更,还要确认供应商承诺的交货日期,能够匹配己方的运输计划。
商品信息管理也是同样的道理。商品属性和分类必须准确无误。同一条商品信息,在德国可能需要满足一套合规要求,在美国加州可能又要符合另一套监管规定。在此类场景中,仅仅输出看似合理的内容,几乎毫无价值。任务必须在对应的业务系统中准确无误地完成。
如果仅凭输出的文字来评判AI智能体,无异于只靠笔试成绩考核飞行员,却不检验他们能否驾驶飞机平稳着陆。
以结果为评价标准
正因如此,阿里国际站Accio团队推出面向全球外贸场景的AI智能体,并专门开发了一套以最终结果为评价标准的基准测试。这套名为CommerceAgentBench的测试现已在GitHub开源,其中包含107项端到端任务,均源自真实电商运营场景,涵盖采购、物流、商品发布、履约和售后服务等环节。
这些任务取自我们的自有数据,包括1,000万活跃中小企业用户、160万条真实对话记录和20万条执行轨迹,最终归为七大类商业工作场景。
这套测试按最终状态评分。例如,商品属性无误并顺利上线,则视为通过,反之失败;货物按照实际存在的运输路线运送,才算达标,否则只能滞留在宁波港码头,等待相关人员查清问题所在。
商业世界向来以成败论英雄。如果客户收到错发的商品,那么AI智能体在下单时表达得多么动听,对客户而言都没有意义。唯有执行结果才是真正重要的衡量标准。
测试发现
我们测试的最强前沿模型,任务成功率也仅为61.7%。
这个数字高到足以证明其实用价值,却又低得足以令人警醒。就在不久前,自动化系统还无法胜任多步骤商业任务;如今在大多数情况下,系统已能完成此类任务。但仍有近四成任务会出现差错。
失败案例集中出现在几类典型场景。AI智能体难以发现隐藏在冗长供应商邮件往来中的付款异常,因为这类异常,只有通读全部300封邮件,才会暴露出欺诈的本质。当落地成本的计算同时涉及多个变量时,智能体极易出错。在售后纠纷处理中,如果需要核对相互矛盾的文件,任务就容易失败。此外,多程运输路线的处理,也始终是智能体的薄弱环节。
而上述任何一种情况,在现实商业运营中每天都会发生数千次。
随着智能体应用规模的扩大,风险的性质也会发生变化。当数千家企业运行同类智能体时,原本孤立的个体错误可能演变成联动性风险:错误商品信息可能成倍增加,欺诈风险信号可能被遗漏,运输路线安排或合规方面的差错可能沿着供应链层层扩散。评测能够清晰显示,哪些自动化场景已具备规模化条件,哪些环节仍需要人工同步监督。
相比61.7%的整体任务成功率,另一个测试结果更令我意外:没有任何一个模型能包揽所有任务第一名。不同模型在不同类别的任务中各有优势。有的模型在询报价处理和市场调研方面排名第一,却在索赔处理和商品合规审核任务中被其他模型反超;有的模型则在商品发布和退货处理方面表现最为出色。单纯依靠通用推理能力得分建立的排名,几乎无法预判某个系统在具体商业任务上的表现。正因为如此,模型的选择应当由具体工作任务决定。
精准授权
对一家企业而言,这种宏观风险转化为一个非常务实的问题:相比行业内的最强模型之争,企业真正应该思考的问题要更加具体——究竟有哪些工作流程现在就能放手交给AI智能体,哪些依然需要自己亲自处理?以交付结果为标准的基准测试,恰恰能够回答这个问题。对于通过率较高的任务,如供应商比价和常规商品发布等工作,企业大可交由AI智能体处理。而对于通过率较低的任务,例如特殊的合规问题、复杂的谈判,以及在任何商业运营中占比远超预期的各种例外情况,则应保留人工参与,并对AI的工作结果进行审核。
我把这种做法称为“精准授权”。一旦明确了AI智能体在哪些任务上表现可靠,就可以停止人工持续监督;一旦知道了它容易在哪些环节失灵,就能在客户之前及时发现错误。两者都能帮助企业节省成本,而如果没有评测机制,这一切都无从谈起。
商业领域需要这样的测试,其他行业也是如此。物流、金融、制造业、医疗和法律服务等行业,都有各自特殊的复杂场景。每个行业都需要建立评测基准,其制定者必须真正了解不良结果可能产生的代价,而且基准也应当保持开放,让买方能够据此检验供应商宣称的能力。
权限将逐步移交给AI智能体:每跑完一个工作流程,它才能赢得一份授权。如今,约书亚拥有了十个“分身”。而他接下来需要解决的问题是:在这十个分身中,有哪些已经可以让他彻底放手、无需复核。
本文作者张阔现任阿里巴巴(Alibaba.com)国际站总裁。
Fortune.com上发表的评论文章中表达的观点,仅代表作者本人的观点,不代表《财富》杂志的观点和立场。(财富中文网)
译者:刘进龙
审校:汪皓
约书亚·斯坦克尔在洛杉矶经营着一家名为Clean Saint的公司,主营免水型口腔护理膜。这家公司实际上只有他一个人。他借助AI处理采购、营销、网站建设和客户服务等事务。当被问及对这种模式的感受时,他这样描述:“从某种意义上说,我现在仿佛拥有了十个分身。”
这句话的后半句耐人寻味:如果你真的拥有十个“分身”,就必须有办法确认另外九个“分身”到底有没有把工作做好。
目前,关于AI的讨论,大多仍聚焦于同一个问题:哪个模型最好?但对企业而言,这并不是合适的衡量标准。模型能做的是逻辑推理,而商业运作涉及给供应商打电话、报关、追查错过船期的集装箱、处理退货等具体环节,这些任务没有一项可以单凭模型独立完成。真正能够完成工作的是AI智能体,它由三部分组成:负责思考的模型;赋予其工具、记忆和行动能力的运行框架;以及让它明白“在特定行业中何为理想结果”的业务场景。在阿里国际站,这种场景认知,源自27年来对全球贸易实际运转的持续沉淀。
真实商业场景对AI智能体提出了哪些要求
如今,AI行业已经非常擅长评估模型的智能水平。各类基准测试涵盖了推理、编程、数学、事实检索,并逐渐延伸至工具调用能力。然而,现实中的商业运作远比这些基准测试所反映的情况繁复得多。单看书面流程,采购任务似乎很简单,但在实际操作中,可能意味着要横向对比数十份报价,找出产品规格书第四页隐藏的前后矛盾之处,仔细审查付款条款,以察觉其中悄然发生的变更,还要确认供应商承诺的交货日期,能够匹配己方的运输计划。
商品信息管理也是同样的道理。商品属性和分类必须准确无误。同一条商品信息,在德国可能需要满足一套合规要求,在美国加州可能又要符合另一套监管规定。在此类场景中,仅仅输出看似合理的内容,几乎毫无价值。任务必须在对应的业务系统中准确无误地完成。
如果仅凭输出的文字来评判AI智能体,无异于只靠笔试成绩考核飞行员,却不检验他们能否驾驶飞机平稳着陆。
以结果为评价标准
正因如此,阿里国际站Accio团队推出面向全球外贸场景的AI智能体,并专门开发了一套以最终结果为评价标准的基准测试。这套名为CommerceAgentBench的测试现已在GitHub开源,其中包含107项端到端任务,均源自真实电商运营场景,涵盖采购、物流、商品发布、履约和售后服务等环节。
这些任务取自我们的自有数据,包括1,000万活跃中小企业用户、160万条真实对话记录和20万条执行轨迹,最终归为七大类商业工作场景。
这套测试按最终状态评分。例如,商品属性无误并顺利上线,则视为通过,反之失败;货物按照实际存在的运输路线运送,才算达标,否则只能滞留在宁波港码头,等待相关人员查清问题所在。
商业世界向来以成败论英雄。如果客户收到错发的商品,那么AI智能体在下单时表达得多么动听,对客户而言都没有意义。唯有执行结果才是真正重要的衡量标准。
测试发现
我们测试的最强前沿模型,任务成功率也仅为61.7%。
这个数字高到足以证明其实用价值,却又低得足以令人警醒。就在不久前,自动化系统还无法胜任多步骤商业任务;如今在大多数情况下,系统已能完成此类任务。但仍有近四成任务会出现差错。
失败案例集中出现在几类典型场景。AI智能体难以发现隐藏在冗长供应商邮件往来中的付款异常,因为这类异常,只有通读全部300封邮件,才会暴露出欺诈的本质。当落地成本的计算同时涉及多个变量时,智能体极易出错。在售后纠纷处理中,如果需要核对相互矛盾的文件,任务就容易失败。此外,多程运输路线的处理,也始终是智能体的薄弱环节。
而上述任何一种情况,在现实商业运营中每天都会发生数千次。
随着智能体应用规模的扩大,风险的性质也会发生变化。当数千家企业运行同类智能体时,原本孤立的个体错误可能演变成联动性风险:错误商品信息可能成倍增加,欺诈风险信号可能被遗漏,运输路线安排或合规方面的差错可能沿着供应链层层扩散。评测能够清晰显示,哪些自动化场景已具备规模化条件,哪些环节仍需要人工同步监督。
相比61.7%的整体任务成功率,另一个测试结果更令我意外:没有任何一个模型能包揽所有任务第一名。不同模型在不同类别的任务中各有优势。有的模型在询报价处理和市场调研方面排名第一,却在索赔处理和商品合规审核任务中被其他模型反超;有的模型则在商品发布和退货处理方面表现最为出色。单纯依靠通用推理能力得分建立的排名,几乎无法预判某个系统在具体商业任务上的表现。正因为如此,模型的选择应当由具体工作任务决定。
精准授权
对一家企业而言,这种宏观风险转化为一个非常务实的问题:相比行业内的最强模型之争,企业真正应该思考的问题要更加具体——究竟有哪些工作流程现在就能放手交给AI智能体,哪些依然需要自己亲自处理?以交付结果为标准的基准测试,恰恰能够回答这个问题。对于通过率较高的任务,如供应商比价和常规商品发布等工作,企业大可交由AI智能体处理。而对于通过率较低的任务,例如特殊的合规问题、复杂的谈判,以及在任何商业运营中占比远超预期的各种例外情况,则应保留人工参与,并对AI的工作结果进行审核。
我把这种做法称为“精准授权”。一旦明确了AI智能体在哪些任务上表现可靠,就可以停止人工持续监督;一旦知道了它容易在哪些环节失灵,就能在客户之前及时发现错误。两者都能帮助企业节省成本,而如果没有评测机制,这一切都无从谈起。
商业领域需要这样的测试,其他行业也是如此。物流、金融、制造业、医疗和法律服务等行业,都有各自特殊的复杂场景。每个行业都需要建立评测基准,其制定者必须真正了解不良结果可能产生的代价,而且基准也应当保持开放,让买方能够据此检验供应商宣称的能力。
权限将逐步移交给AI智能体:每跑完一个工作流程,它才能赢得一份授权。如今,约书亚拥有了十个“分身”。而他接下来需要解决的问题是:在这十个分身中,有哪些已经可以让他彻底放手、无需复核。
本文作者张阔现任阿里巴巴(Alibaba.com)国际站总裁。
Fortune.com上发表的评论文章中表达的观点,仅代表作者本人的观点,不代表《财富》杂志的观点和立场。(财富中文网)
译者:刘进龙
审校:汪皓
Joshua Stancle runs Clean Saint out of Los Angeles. The product is a waterless oral-care film. The company is him. He uses AI for sourcing, marketing, web development, and customer support, and when we asked him what that felt like, he put it this way: “In a sense, there are ten of me.”
I keep coming back to the second half of that sentence. If there are ten of you, you need some way of knowing whether the other nine are getting the work right.
Most of the AI conversation still runs on a single question. Which model is the best? For a business, that is the wrong unit of measurement. A model reasons. Commerce means calling a supplier, filing a customs form, chasing a container that missed its vessel, handling a return, and a model does none of that by itself. Work gets done by an agent: the model that thinks, a harness that gives it tools and memory and the ability to act, and context that tells it what a good outcome looks like in a specific industry. At Alibaba.com, that context comes from 27 years of watching global commerce actually happen.
What commercial work asks of an agent
The industry has become very good at measuring intelligence. Benchmarks cover reasoning, coding, mathematics, factual recall, and increasingly tool use. But real commercial work is somewhat messier than any of that. Sourcing looks simple written down. In practice, it means comparing dozens of quotes, catching an inconsistency buried on the fourth page of a specification sheet, reading payment terms closely enough to notice when they have quietly changed, and confirming that a promised delivery date survives contact with your shipping schedule.
Product listings have the same texture. Attributes have to be right. Categories have to be right. The same listing may have to satisfy one set of regulatory requirements in Germany and a different set in California. Plausible output has very little value here. The job has to be finished, correctly, in the system where it lives.
Testing an AI agent only on what it says is like grading pilots on a written exam without asking them to land the plane.
Grade the outcome
That is why the Accio team at Alibaba.com, which offers an AI agent built for global commerce, developed a test that grades outcomes. CommerceAgentBench is open source and available on GitHub. It contains 107 end-to-end tasks pulled from real e-commerce operations across procurement, logistics, product listing, fulfillment, and after-sales service.
We assembled them from what we could see in our own data: 10 million active small-business users, 1.6 million real conversations, and 200,000 execution traces, sorted into seven categories of commercial work.
Grading happens on the end state. The listing either went live with the correct attributes or it did not. Freight moves on a route that exists, or it sits on a dock in Ningbo while somebody works out what went wrong.
Commerce has always kept score this way. A customer who receives the wrong product has no interest in how articulate the agent sounded when it placed the order. Execution is the benchmark that matters.
What we found
The strongest frontier model we tested successfully completed 61.7% of the tasks.
That figure is high enough to be useful and low enough to be a warning. Multi-step commercial work that sat beyond the reach of automation until recently now completes most of the time. But close to four in ten tasks still came back wrong.
The failures clustered in recognizable places. Agents struggled to spot a payment anomaly hiding inside a long supplier email thread, the kind of thing that reveals itself as fraud only after somebody has read all 300 messages. Landed cost gave them trouble once the calculation involved several moving variables at once. After-sales disputes broke down whenever the answer required reconciling documents that disagreed with each other. Multi-leg shipping routes were consistently hard.
Every one of those happens thousands of times a day in real businesses.
The risk changes as adoption scales. Across thousands of businesses using similar agents, individual mistakes could become correlated ones: inaccurate listings could multiply, fraud signals could be missed, and routing or compliance errors could ripple through supply chains. Measurement shows where automation is ready to scale, and where human oversight still needs to keep pace.
One result surprised me more than the headline number. No single model won. Leadership rotated by category. The model that ranked first on request-for-quote work and market research slipped behind on claims settlement and listing compliance, where a different model led. A third was strongest at publishing products and handling returns. A ranking built from general reasoning scores tells you very little about which system will perform on a particular commercial task, which is why the choice of model belongs to the job.
Precision delegation
For an individual business, that broader risk translates into a practical question: The question worth asking is narrower than the one the industry argues about. Which workflows can I hand over now, and which ones still need me? A benchmark that grades outcomes answers exactly that. Where the pass rates are high, supplier comparison and routine listing work can come off your desk. Where they are low, on unusual compliance questions and complicated negotiations and the exceptions that make up more of any commerce operation than anyone expects, keep a person in the loop and check the work.
I call this precision delegation. Once you know where an agent is dependable you can stop supervising it, and once you know where it breaks you can catch the failure before a customer does. Both save money. Neither is available without measurement.
Commerce needs a test like this and so does everything else. Logistics has its own edge cases, and so do finance, manufacturing, medicine, and legal services. Each field will need a benchmark built by people who understand what a bad outcome costs there, and those benchmarks should be open, so that a buyer can check a vendor’s claim against something.
Authority will move to agents one workflow at a time, as each one earns it. Joshua has ten of himself now. What he needs next is a way to know which of the ten he can stop checking.
Kuo Zhang is President of Alibaba.com.
The opinions expressed in Fortune.com commentary pieces are solely the views of their authors and do not necessarily reflect the opinions and beliefs of Fortune.