亚马逊 Mechanical Turk 将于 9 月 30 日关停
文章摘要
亚马逊在 mturk.com 首页挂出公告:Amazon Mechanical Turk 将于 2026 年 9 月 30 日永久关闭。 官方措辞一如既往地简短克制——「我们会定期评估自己的项目、工具和服务,并据此做出调整。经过评估,我们决定关闭 Amazon Mechanical Turk,2026 年 9 月 30 日生效。」现有的 Worker(接活的人)和 Requester(发活的人)被引导去 FAQ 页面了解如何准备。此前在 2026 年 7 月,该服务就已停止接纳新客户。
MTurk 于 2005 年上线,名字取自 18 世纪那台内藏真人棋手的「土耳其行棋傀儡」,其著名的宣传语是「artificial artificial intelligence」(人工的人工智能)。它是众包微任务市场的开创者:把企业流程拆解成大量可独立完成的「microtask」(微任务),分发给全球全天候在线的分布式劳动力,Requester 可以通过网页界面或 API 直接集成。首页列出的三大卖点是提升效率(把简单重复的人工环节外包出去,让内部员工专注更高价值的工作)、增加弹性(无需自建团队即可弹性扩缩劳动力)和降低成本(按任务付费)。
页面上罗列的典型用例极具时代感——大部分与机器学习直接相关:为训练模型收集和标注海量数据、human-in-the-loop(人在回路)的模型验证与再训练、为计算机视觉数据集画边界框;以及内容审核、图像与商品分类、数据去重、从网站抓取信息、问卷调查等业务流程外包。页面上引用的两条客户证言分别来自 Allen Institute for AI 的工程总监 Michael Schmitz(用 MTurk 构建帮助模型学习常识知识的数据集)和 Food Genius / US Foods 的 David Falck(从菜单和网站收集消费趋势数据)。
一个耐人寻味的细节:页面底部的版权声明仍停留在「© 2005-2018」——这个曾经定义了一个时代的产品,在被正式宣告死亡之前,事实上已经沉寂了很多年。
HN 评论精华
533 分、165 条评论。讨论的基调是「一个时代的终结」,但真正的重头戏是三个方向:为什么偏偏在这个时候关、MTurk 数据质量一直很糟,以及大量老用户的怀旧故事。
关停时机的悖论是最被反复提起的一点。 conception 说得最直接:「在这个服务可能性最大的时刻把它关掉,实在有点疯狂。一个 agent 加上多个真人在物理世界执行任务,听起来是件很有威力的事。」akshay_akula 附议「时机太讽刺了,正好赶上 agent 加真人做现实世界任务重新变得有意思的时候」。robot_jesus 给出了扎心的对比:Mercor 估值 200 亿美元,做的基本是同一件事,却在拼命找工人。dec0dedab0de 提供了一个冷静的解释:「LLM 不需要一个 API 来雇人。」
内部视角来自 x0xMaximus,自称「过去十年 AMT 最大的 Requester」:这个消息是与 Worker 同时通知给 Requester 的(也就是说大客户毫无预警);更关键的是,他们的对接人——AWS 负责 AMT 的高级项目经理——两三年前就转去做 Amazon Bedrock 和 SageMaker Model Evaluations 了,「在把存储价值账户迁移到 AWS 原生计费之后,基本上没留下任何团队在管这个项目」。ghaff 从业务角度佐证:「即便不算 AI,MTurk 多年来在 AWS 内部就是个异类,所以并不意外。」cmiles8 感慨亚马逊从「我们从不砍产品」变成了持续关停的节奏。
AI 污染是公认的直接死因。 madrox 的分析被广泛认同:MTurk 主要做的是非技能性任务,而这类任务 AI 已经做得足够好,好到不值得为了验证或继续外包给人类而付差价;如今需要「trust but verify」的 AI 输出都要求领域专业知识,「这已经不可能是一门横向生意了」。dubeye 说自己为垂直领域自建了类似系统,最大的问题就是没法验证工作不是 AI 做的:「如果能确切验证不是 AI 做的,我认为这个市场还在。但数据就是不可信了。」他还指出一个规模化难题:工人通常靠手工干活积累信任,然后随时间逐渐劣化。somenameforme 的判断更悲观:任何相对开放的平台都会被 LLM 毁掉,而建立高信任、高验证的市场会把价格推到没人愿意用的程度,最终仍是「先取得信任再交给 LLM」的猫鼠游戏。willmeyers 预测 Fiverr 和 Upwork 也会收缩。bentt 一句话概括:「从训练 AI,到有人把 AI 接上去。Slop as a service。」
质量问题其实一直存在,早在 LLM 之前。 somenameforme 指出即使在 LLM 时代之前,MTurk 数据也相当糟:一群人抢着尽快作答好赚那两毛五,「本质上是在测试你能多快随机作答,同时又留意到那道写着『请选 D』的注意力检查题」。rcr-anti 给出了一个惊人的实测:几个月前用 MTurk 与 Bedrock 的 ground truth 集成跑 MNIST 手写数字识别——本该是最平凡的任务——花了 10 美元,准确率只比瞎猜好一点点,完全不可用,「我完全懵了,人们可是在拿纯 MTurk 结果发同行评审论文的」。raverbashing 讥讽道,MTurk 也是心理学等专业学生凑够 N 个被试做「研究」的地方。ealready_value 则提供了一条来之不易的实操经验:八年前他们用 MTurk 从各种来源的 PDF(有些是扫描件的扫描件)读取数据,为此写了一整套应用来管理流程——同一任务要多份作答、互相比对、找共识、识别并封禁持续给出坏答案的用户——最终把正确率做到 85%~95%。他学到的最反直觉的一课是:他们原以为价格是质量旋钮,很快发现价格是速度旋钮,价高任务被领走和完成得更快,但质量并不随价格显著变化。
从工人视角看,这个平台并不体面。 utopiah 说自己 2007 年前后试过,任务是能完成,但「令人身心衰弱」:「如果你觉得办公室工作已经很无聊,那把它切成更小的、你毫无自主权的碎片,从劳动者角度看简直糟透了。」他原本想借此提供一项基于数据集的服务,亲身体验后放弃了,「这从根本上改变了我对监督学习的看法,可惜不是往好的方向」。tempfile 只说了四个字:「邪恶的生意,很高兴摆脱它。」winterbourne 提醒了另一面:「这对基础设施薄弱国家的大量工人来说会是毁灭性打击。」zackmorris 的评论带着愤怒:「当 AI 终于能在 MTurk 上赚被动收入的那一刻,他们就把它关了。激励是双向的。如果人类劳动对资本的汇率跌到零,人类工人就只能把资本从等式里剔除。没有工作,没有钱,没有亿万富翁。」
怀旧故事是这个帖子最好看的部分。 wanderingstan 请人转录父亲的手写信件和日记,「收到一位『Turk』的留言说她很享受读他的旅行经历、追着他生命中那些人物的故事,很打动我」。transitorykris 说自己唯一一次当 Turk,是数据库先驱 Jim Gray 在海上失踪时,太平洋大片区域的卫星图像被送上 MTurk 供人排查。donalhunt 提到另一次著名的众包搜救——2007 年 9 月寻找失踪飞行员 Steve Fossett,yard2010 从维基百科贴出了残酷的后续:搜救指挥官 Cynthia Ryan 后来表示这次众包「与其说是帮助不如说是妨碍」,声称目击或掌握特殊信息的人在关键几天里塞爆了她的邮箱,很多所谓目击其实是执行搜索网格的 CAP 飞机或旧图像的伪影,还有通灵者涌向明登搜救基地,而美国空军专家不得不认真处理每一条信息,「回头看,这次众包尝试『还没准备好上台面』」。wileydragonfly 说自己在会议间隙做任务赚了几千美元,「多多少少写完了某人的博士论文」——反复有人给他一美元,让他总结各种心理学论文的发现,最难忘的一篇是把「liquid ass」喷雾喷在房间墙上的实验:没被告知任何解释的受试者,焦虑水平高于那些被告知「正在修污水管漏点」的人。nerevarthelame 坦白了另一种玩法:亚马逊早期为了拉动平台自己发的很多任务都极易自动化,「你基本上 100% 选『以上都不是』就能让质量分高于阈值」;他和朋友写了脚本、占领大学机房的一堆电脑跑,赚了几千块,「没去参加派对,好时光」。ge96 记得自己干过的是可疑活儿——搜索并点击链接来操纵 Google SEO 排名;最古怪的是翻检社交媒体图片,「窥见陌生人的生活,太奇怪了」。runamuck 爆料某位极有名的说唱歌手起家,是因为经纪人 Shane Morris 用 MTurk 在 Spotify 上刷互动,直到 Spotify 开始识别这一手段。
最妙的两条短评:用户名恰好是 mturk 的人留言「10 月 1 日我还在」;shermantanktop 说 MTurk 以前的标语是「artificial artificial intelligence」,「看来现在我们只需要一个『artificial』就够了」——inigyou 接:「不需要『intelligence』。」HlessClaudesman 则给出了本帖最好的收尾:「砍掉一个 mechanical turk,会有两个站起来取代它。」——这句话在帖子里几乎立刻应验:yashvg(Humwork,YC P26)和 GeoBounties 两家创业公司当场在评论区打起了广告,前者做「让 AI agent 通过 MCP/API 在 30 秒到 3 分钟内接通经过审核的领域专家」,后者做「让 AI agent 调度真人执行现实世界任务」。paxys 早就点破了这一点:这个概念不会消失,只是服务对象从「想找人干重复活的普通人」变成了大型 AI 公司。