
有没有想过用 AI 来建立个可以提前运行未来的世界,让 AI 预测人类社会的未来?
这个想法其实正在被实现,硅谷顶 VC 投入了 几亿美元支持这个向的初创企业。这就是基于 AI Agent(智能体) 的 User Simulation(以下翻译成"用户模拟")。它的核心主张很简单,用成千上万个 AI 智能体去仿真人类群体的决策行为,形成了个可以"预测未来"的沙盘。这项技术不仅可以用来预测美国大选,也可以用来模拟上市公司的财报会,还被谷歌内部用来做产品测试。
硅谷投研圈访谈了 User Simulation 行业先行者 Reynold(前 Gmail Copilot 产品负责人,UserApproved.ai 创始人),我们发现:从电商到政选举,场关于"用户模拟"的技术革命正在悄然发生。当大模型不再只是回答问题,而是开始模拟人类行为、预测群体决策,AI 的边界正在被重新定义。
、从 Gmail 到创业:个产品经理的"模拟"觉醒
这个故事,是硅谷 AI 浪潮中个具代表的缩影。
在 Google 的五年里,Reynold 先后主了 Google Assistant 车载体验、Gmail 的 Gemini 产品线,亲历了大模型从"玩具"到"生产力工具"的蜕变。但真正让他选择离开、创立 Apex Agent Labs(名 UserApproved AI)的,是个被大多数人忽视的问题:当 AI 产品变得越来越复杂,我们该如何验证它真的好用?
"早我们做智能音箱、智能眼镜上的 AI,测试质量相当基础——写堆规则,跑遍就完了。"他回忆道。但大模型时代,个 Gmail 的 AI 助手可能需要同时读取邮件正文、附件、Google Drive 里的 PDF 和表格,甚至跨多个 Google 服务调取信息。"数个组,多步骤的 agentic workflow,你很难验证终成果是不是好的。"
Google 内部的解法,是构建成数据(synthetic data)——模拟用户的收件箱、文档、邮件往来。但很快发现了个致命问题:在实验室里表现优异的 AI,到真实用户手中就"翻车"。
"我们在后台看 alpha、beta 用户的数据, 数据表现怎么这么差?。"这个落差,成为探索"用户模拟"的起点。
二、用户模拟的五大层:从数据生成到群体预测
在我们梳理的框架里,用户模拟并非单技术,而是个由浅入的五层架构:
层:数据与场景模拟
解决的是数据稀缺问题。模拟用户的收件箱、Google Drive、PDF 文档等"人工制品",为 AI 训练和评估提供素材。这看似基础,实则充满复杂——如何让成的邮件看起来真实?如何让文档之间的引用关系符逻辑?
二层:交互模拟玉林橡塑胶
测试对话式 AI 的边界。定义不同 persona(人格画像),从各种角度和语气与 AI 对话,测试其是否会"跳出"安全边界。这也是 Google 新 Agent Development Kit(ADK)中 user simulation 所处的层——个快速验证工具,但我们认为"离终结果还有点远"。
三层:用户旅程与环境模拟
不再是单次交互,而是持续的、有记忆的多步骤旅程。用户不会只问个问题就离开,他们会浏览、犹豫、遗忘、返回——这些"持续"行为需要被模拟。
四层:个体度模拟
这是 UserApproved 主攻的向,也是斯坦福大学 HCI 实验室孵化的 Simile 所耕的域。通过度访谈(两小时以上)+ 结构化问卷,构建个从心理学和行为学层面尽可能""模拟个体的系统。
"传统用人口统计数据模拟,有太多预训练模型自带的局限。"他解释道。Simile 的法是用度访谈"引模型思考",让 AI 不只是"扮演"那个人,而是在拥有全部上下文后预测其行为。研究表明,这种法能将准确率提升 10~15。
五层:群体智能与预测市场
以 Aaru 为代表,试图模拟"整个世界"的人怎么想。不是关注单个 agent 是否 准确,而是看几千、几万个 agents 交互后产生的集体洞察——预测美国大选、市场趋势、政策影响。
三、硅谷火赛道:Simile 与 Aaru 的亿元融资背后
2025 年,用户模拟成为硅谷炙手可热的赛道之。Simile 和 Aaru 两公司计融资几亿美元,背后是对"预测未来"这终能力的追逐。
Simile 的学术基因
从斯坦福 HCI 实验室走出,Simile 的学术基因令人瞩目。他们曾在虚拟小镇(Smallville)中模拟数十个自主 Agent 的社交与生活互动,震撼业界;发表 GUM(General User Models)论文,将视觉线索与思维模拟结;核心的是那篇" 1052 人研究"——用两小时度访谈 + 结构化问卷模拟个体,大幅缓解了长期困扰行为科学的 "说做不"(say-do problem) 问题,让 AI 能够真实地预测人类的隐含决策。
大可能在社交网络上说支持民主党、讨厌特朗普,但偷偷给特朗普投票。"我们了解到玉林橡塑胶,大模型里收集了大量态度数据,但行为数据稀缺。" Simile 的法某种程度上解决了这个不致。
Aaru 的宏观视角
与 Simile 的"微观到宏观"路径不同,Aaru 擅长从宏观趋势个体行为。他们与安永(EY)发布的报告声称能在天内复现需要数月的调研结果,相关达 0.9。但我们也提出了审慎看法:EY 报告并非开放的架构,且预测的是"已发生的调研"而非小概率事件——"面对局部、数据稀缺的场景,比如萨克拉门托的市长选举,难度会大很多。"
四、从概念验证到商业落地:电商域的"模拟革命"
UserApproved 选择了条垂直的路径——电商与 DTC(直接面向消费者)。
"我们很难做个通用的 agent,既能购物、又能报税、又能建站。"他坦承早期技术局限,PVC管道管件粘结胶"但购物行为相对‘可模拟’——目的明确,就那几个大类别。"
产品的逻辑颇具野心:不做"实习生别"的情报罗列,而是做"总监别"的决策建议。
具体而言,系统会接入的 GA4(Google Analytics)、Shopify、Clarity、Hotjar 等真实生产数据,同时运行用户模拟 agent 在虚拟环境中"购物"——"朋友告诉我今天有促销,我去看看;逛了会儿,看到点进去,然后忘了——这些真实的行为路径都会被记录。"
终,系统每天输出:"今天有三件事要做,做完 revenue 可能涨 5 万美元。"
"我们还有个 QA agent、个用户模拟 agent(相当于虚拟 UXR)、行为分析 agent,甚至监控竞争对手的 agent。所有洞察汇总成个 backlog,告诉客户该做什么。"这是个"云机器人"(cloud bot)持续运转、多 agent 协作的未来图景。
五、A/B 测试的终结者?不,是"预飞检查"
用户模拟能否取代 A/B 测试?这是业界常问的问题。我们的答案很明确:不能,但能让 A/B 测试。
以 Shopify 等平台早期的成用户评估实验为例——如果直接让大模型扮成买去给 A/B 测试分,果往往很差。个主可能只改了句促销文案,AI 模拟用户却得出了" B 比 A 好得多"的夸张结论,理由是堆被放大的小细节。 "大模型很容易做‘应声虫’(yes-man)。你让它找问题,它就会把芝麻大的问题说成‘世界要毁灭了’。"同样玉林橡塑胶,预训练模型自带的偏见很难规避,大的样本量也解决不了根本问题。
但用户模拟的价值在于"预飞检查"(pre-flight) ——在投入数周、大量流量成本做真实 A/B 测试前,先剪掉那些"明显会失败"的案。"本来要测 10 个,现在只需要测 3 个。省钱、省时间、省流量。"
六、技术水区:认知架构、致与"故意犯错"
当说到 state-of-the-art 的用户模拟 agent 架构时,我们揭示了技术实现的三个关键层面:
层:认知与幻觉
论是 Simile 的"三层架构"(记忆流 - 反思 - 规划),还是借鉴传统 BDI(信念 - 欲望 - 意图)的智能体决策框架,核心解决的都是让 Agent 在多步骤动态交互中实时新认知状态,并在每步预测时不偏离设定的 persona。接收信号、情绪变化、认知新、下步意图——这是个 per-step 的内部循环。
二层:跨步骤致
个购物旅程可能涉及几百步操作。如何在步骤之间保持长期致(long-horizon consistency),不偏离轨迹?记忆系统、反思机制都是为此服务。
三层:重试致
"人不会两次踏入同条河流"——即使相同的外部条件,人类行为也有差。Agent 也不能期望致,但又不能偏离 ground truth 太远。这需要复杂的 metrics(如 normalized accuracy)来"校准"人类的不致。
个反直觉的挑战是:模型太聪明了。
"我们早期想模拟个‘没那么聪明’的用户,GPT 总是把问题解决得太漂亮。我们希望它不解决,它偏要解决。"我们了解到,"做了很多‘微型测试’(miniature test),研究如何让行为与思维对齐。"
七、基模能力:护城河还是颠覆者?
随着 GPT-4、Claude 等基模能力飞速提升,用户模拟公司的壁垒是否会被"模型即服务"破?
我们的观察是:基模进步确实降低了技术门槛,但系统的可靠和评估体系仍是护城河。
"有些顶模型在 agent planning 和 simulation 上做得很好,first-step accuracy 和长期致都不错,即使不做复杂的记忆系统。" 但"大部分模型做不到"。重要的是,模型团队的核心目标是"帮你完成件事"(computer use),而非"模拟人到底是怎么想的"——"它不会故意犯错。"
此外,预训练数据的互联网偏见、少数群体代表不足、法谄媚(algorithmic sycophancy)致的"回声壁"应——这些问题都不是单纯靠强的基模能解决的。
从商业决策到数字永生
展望未来,我们认为用户模拟将度嵌入决策流程,成为"正式决策前的 dry run(彩排)"。
商业域:概念测试、定价策略、营销 campaign、财报会议脚本——重要决策前先跑遍模拟。"以后大都会先 dry run,再跑真实 A/B 测试。"
游戏域:测试复杂逻辑 bug、优化"用户充"流程(从 0 到 0.99 美元是游戏公司关键的转化里程碑)。
远的想象:数字孪生 2.0
"现在的数字孪生是‘换皮’——脸像、声音像,但思想和行为不像。用户模拟可以让数字孪生真正‘活’过来。"我们了解到陪伴、逝去的人等场景,"让这个人好像从未离开过你。"
这与当下流行的"名人蒸馏"(把巴菲特、段永平、芒格的文章访谈整理成 AI)有本质区别——后者是" QA 引擎",而用户模拟追求的是思考式的复现。
预测未来的艺术
用户模拟不是水晶球。它法 替代真人,法消除所有偏见,法保证每次预测都准确。但它正在成为种新的"基础设施"——在不确定中剪除坏的选项,在复杂中找到值得验证的向。
当大模型从"回答问题"进化到"模拟行为",从"生成内容"进化到"预测决策",我们或许正在见证 AI 的三次浪潮:次是信息检索,二次是内容生成,三次是行为预测。
而"用户模拟"的前行者们,正站在这股浪潮的前沿。相关词条:铝皮保温 隔热条设备 钢绞线厂家玻璃棉 泡沫板橡塑板专用胶
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。