Simile:把真人做成AI分身,5个月估值20亿美元
AI模拟真实用户正成为市场调研的新范式。Simile通过深度访谈建立消费者AI分身,让企业随时测试产品、价格与广告策略,将传统数周的调研压缩至数小时。本文拆解其技术路径与商业逻辑,探讨行为模拟如何重塑决策流程。

今天分享的这个产品赛道其实我之前分享过 – 用 AI 模拟真实用户,搭建“虚拟消费者”:Simile,https://simileai.site/
如果一家公司准备推出一个新产品,通常会先做什么?
找几百个人发问卷,找几十个人做访谈,或者预算多一点,再开几场焦点小组。
产品已经上线了,还可以做 A/B 测试:一半用户看到方案 A,一半看到方案 B,然后看谁的转化率高。
这些方法用了几十年,但都有一个共同的问题:
每提出一个新问题,基本都得重新找一批人。
如果今天想测试包装,招一次人;下个月想调整价格,再招一次;过几个月准备换广告,又重新做一轮。
而一家叫 Simile 的 AI 公司,正在尝试换一种方法:
第一次把真人找来以后,给他们分别建立一个 AI “分身”。
以后企业有新的产品、广告、价格、服务流程,先不用找真人,直接让这些 AI 分身试一遍。
它们可以回答问卷、评价产品、比较两个方案,也可以继续被追问:
“你为什么不喜欢?”
“如果便宜10美元呢?”
“如果换成另一种宣传方式呢?”
甚至还可以把几十万甚至更多这样的 AI 放进同一个模拟环境里,看不同人互相影响以后,会发生什么。

今年7月30日,Simile 完成新一轮融资,本轮 B 轮融资达到 2亿美元,估值 20 亿美元。
而就在五个月前,这家公司才刚刚公开亮相,并宣布了 1亿美元 A 轮融资。
五个月里,Simile 称自己的收入增长了 5倍,团队扩张到 50多人,并已经为财富 100强企业运行了数千万次模拟。
目前披露的客户包括 CVS Health、Wealthfront、Deloitte 和 Gallup。
而它的创始人 Joon Sung Park 给公司定下的长期目标更加夸张:
模拟地球上的80亿人。
01 一切从 25 个住在虚拟小镇里的 AI 开始
Joon Sung Park 的经历不太像典型的 AI 创业者,他曾经学习油画,后来进入斯坦福读计算机博士。
他的博士导师是两位斯坦福计算机教授 Michael Bernstein 和 Percy Liang,后来这两个人也成为了 Simile 的联合创始人。

Percy 还是“基础模型”这一概念早期论文的重要作者之一。
2023年,Park 和团队发表了一篇后来非常出名的论文《Generative Agents》。
他们做的实验也很好理解:
研究人员搭了一个类似《模拟人生》的虚拟小镇,叫 Smallville,然后往里面放了 25个 AI 居民。
这些居民不是传统游戏里的 NPC。
传统 NPC 的行为是程序员提前写好的:
上午9点站这里,玩家走过来以后说这句话,触发任务以后走到另一个地方。
Smallville 里的 AI 居民没有这样完整的剧本。
它们拥有自己的“记忆”,今天见了谁、聊了什么、发生了什么事情,会被保存下来。
AI 还会从这些记忆里总结经验,形成新的判断,再决定明天干什么。
整个架构的核心被拆成了几个很简单的能力:记忆、反思和计划。

研究人员只给其中一个角色一个想法:准备办一场情人节派对。
接下来发生的事情没有被逐条写进程序。
这个角色开始邀请别人,被邀请的人又把消息告诉其他人。
有人开始讨论派对,有人约别人一起去,最后真的有一群 AI 居民在约定的时间来到派对。
它第一次证明了一件事情:
大模型不一定只能“回答一个问题”,也可以拥有记忆,在环境里连续生活,并因为过去发生的事情改变后面的选择。
但这时候仍然有一个很大的问题,Smallville 里的居民毕竟都是 AI 编出来的人。
它们行为再像人,也不能证明:它们真的能够模拟一个现实中的人。
于是 Park 做了第二个实验。
这一步,才真正变成今天 Simile 的基础。
02 找 1052 个真人聊两小时,再分别做一个 AI 版本
2024年的研究里,Park 团队找来了 1052名美国成年人。
这些人按照年龄、性别、种族、教育、收入和地区等维度进行抽样,希望尽可能覆盖不同的人群。
然后团队没有让他们简单填一份问卷。
而是给每个人做了一次大约两小时的深度访谈。
因为 1052个人全部由研究人员采访太慢,他们还专门做了一个 AI 采访员。
AI 会问一个人的成长经历、家庭、工作、价值观和生活经验,也会根据前面的回答继续追问。
最后,每个人都会留下相当详细的一份人生访谈记录。
接下来,研究人员把这些内容交给大模型,简单理解就是告诉 AI:
“从现在开始,你不是一个35岁的美国男性,而是刚才接受采访的那个具体的人。”
这两者区别很大。
让 ChatGPT 扮演一个“35岁、已婚、年收入8万美元的男性”,模型很容易调用互联网上关于这类人的平均印象。
结果很可能只是一个看起来合理的“典型人物”。
Simile 想解决的恰恰是这个问题:它不是先创造一个“人设”,而是试图从真实个体的数据出发。
他的经历是什么?过去做过什么选择?怎么看待金钱?是否喜欢冒险?相信什么?讨厌什么?
这些信息共同组成一个更具体的人。
直接让普通大模型模拟消费者,很容易滑向一个“互联网平均人格”;
所以 Simile 的做法是把访谈、过去的选择和其他经过许可的个体数据放进 Agent 里。
现在问题来了:这么做出来的 AI,到底像不像本人?
研究人员用了一个挺聪明的办法。
他们让1052名真人完成社会调查、人格测试、行为经济学实验等一系列任务。
两周以后,再让真人回答一遍。
与此同时,也让他们各自的 AI 分身回答同样的问题。
结果是:
如果把真人两周以后还能多大程度重复自己原来的答案作为参照,AI 分身在综合社会调查中的表现达到了真人自身重复可靠性的约 85%。
在五项社会科学实验中,真人成功复现了其中四项,AI Agent 同样复现了四项。
这里一定要注意:
这不是说“ AI 有 85% 的概率准确预测一个人”。
人自己今天和两周以后回答同一道题,都不一定完全一样。
这个 85% 的意思更接近:
AI 分身表现出来的稳定性,已经开始接近真人自己的稳定性。
这时候,这件事的商业空间由开始出现了。
03 Simile卖的,其实不是“AI人”,而是一群随时可以被叫回来的人
假设你是一个品牌,过去做一次消费者调研,可能找1000个人。
调研结束,人群解散。
三个月后公司突然又冒出来一个问题:“如果我们涨价5%,这些人还买吗?”
抱歉,这时候要重新招人,重新筛样本,重新发问卷,重新统计。
所以,Simile 改变的不是“用 AI 帮你写问卷”,而是:
第一次招募真人的时候,就尽量建立一个可以长期使用的数字版本。
企业以后可以再次找到“同一群人”:
问新的问题,加入新的条件,让他们体验新的产品流程,甚至让他们在不同情境里连续经历几天、几周,然后观察态度有没有变化。
Simile 把这种东西直接称为一个 “Always-on synthetic panel”——永远在线的消费者样本库。
这也是 Simile 和普通“AI 用户画像工具”最大的区别。
普通方法是先写一句提示词:“请模拟一个住在纽约、45岁、有两个孩子的中产女性。”
Simile 的逻辑则更像:
先真的找到这样的人,获取经过许可的访谈、历史选择和行为数据,建立 Agent,再拿企业已经知道答案的问题去测试它。
如果过去调查发现某类消费者有 60%选择A,那么先看 AI 能不能复现这个结论。
复现不了,就继续调整。
Simile 的客户 CVS 甚至会把自己的历史问卷、CRM 记录、客服互动、A/B 测试结果继续加入系统进行校准。
在 CVS 自己的内部测试中,经过这些数据校准后的模拟,对部分已有研究结论的复现一致率最高达到95%。

Simile 今年又增加了一层东西:置信度模型。
它不是只告诉企业:“我的模拟结果是72%的人会购买。”
还试图判断:这个72%,到底有多大把握?
Simile 称已经训练了一个专门预测每次模拟准确性的模型,未来模拟系统需要像统计学里的显著性指标一样,给管理者一个判断结果可信度的标准。
这一层其实非常重要。
因为一家真正把 AI 拿来做企业决策的公司,最大的门槛从来都不是:
“能不能生成一个看起来像真的答案。”
而是:你怎么证明这个答案值得拿来做决定。
04 CVS 已经拿 40多万人的数据开始干这件事了
目前 Simile 最完整的公开案例来自美国医疗和零售巨头 CVS Health。
CVS 披露,其模拟体系目前建立在 40多万名经过同意的真实参与者、290万份回答以及 200 多个行为场景之上。
其中一个具体问题是:
为什么一些患者没有按要求持续用药?
这是一个很典型的传统调研难题。
你当然可以发问卷,但问“你为什么没有坚持吃药”,经常只能拿到非常表面的答案。
而且慢性病患者等特定人群并不好反复招募,有些关于疾病、焦虑甚至不按医嘱用药的问题也比较敏感。
CVS 先让 AI 分身重新跑了一遍过去已经做过的研究,以确认模拟结果基本靠谱。
然后开始不断改变条件。
结果发现,影响患者持续用药的因素并不是简单的“药便不便宜”。
排在前面的因素包括:
对药房是否信任;是否相信药品被正确保存和处理;续药是否方便;取药体验是否顺畅。

接下来,研究人员还可以继续追问那些没有坚持用药的 AI 患者:
“为什么?”
得到的进一步原因包括续药时间上的焦虑、对说明理解不清,以及此前不好的服务经历。
传统上,这种问题从确定研究方案、重新寻找样本到执行访谈,经常需要数周。
CVS 说,现在一部分过程被压缩到了几个小时。
还有一个更加接近普通消费品公司的案例。
CVS 准备推广宠物处方药业务 Pet Rx 时,希望知道养宠物的人到底因为什么做购买决定。
Simile 的模拟先帮助研究人员找出 4 类核心情绪驱动因素,再据此设计出 6 个产品和营销概念进行测试。
CVS 披露,过去可能需要两到三个月、分几轮完成的研究,最后被压缩到了三天。
甚至 CVS 过去散落在不同部门里的大约 50项历史研究,也被重新装进这些经过校准的 Agent 体系里。
这样一个几十年前完成的消费者访谈,理论上不再只是躺在 PPT 里的结论,而可以继续参与新的问题。
这其实比“AI替代问卷调查”有意思得多。
05 它真正改变的,是消费者数据的“使用次数”
传统市场调研有一个很隐蔽的问题:
绝大多数消费者数据,使用一次就结束了。
花钱招1000个人,问20个问题,得到一份报告。
三个月以后问题变了,这 1000 个人的数据大部分已经无法直接回答新的问题。
所以传统研究的成本很大一部分来自:
每产生一个问题,就要重新获得一次人的注意力。
Simile 就是在尝试把这个过程变掉。
只要一个人的数字模型足够准确,而且持续得到新的真实数据校准,过去一次访谈得到的信息就可以被重新组合。
今天问广告,明天问价格,后天模拟新产品。
再过几个月,还可以让这些人和另一群 Agent 放在一起,看口碑如何扩散。
CVS 的案例里,对这套方法的规划也已经从最简单的“ AI问卷”向后走了好几步:
- 第一阶段,是让单个 AI 分身回答问题。
- 第二阶段,是让同一个人连续经历一段时间,观察他的想法如何变化。
- 第三阶段,是让不同 Agent 互相交流,比如患者和药剂师对话。
- 第四阶段,则是把大量 Agent 放进一个带有竞争者、渠道、价格和地理因素的市场里,看一项决策产生的连锁反应。
这时候,Simile 卖的就已经不只是一个“消费者调查工具”。
它想把市场变成一个可以提前运行的沙盘。
产品发布一次,在真实世界里只有一个结果。
但在模拟世界里,你可以把价格改20遍,把广告换50条,让竞争对手做10种反应,再分别运行。
最后才决定:哪几个方案值得真的拿钱出去试。
这也解释了为什么 Simile 自己把产品形容成企业决策的“飞行模拟器”。
06 但显然还没有到“预测人类”的程度
Simile 的商业模式最容易被夸大传播的,就是在这里。
Joon Sung Park 说公司的长期目标是模拟全球 80 亿人。Simile 官网甚至把自己的方向定义成建立“人类行为基础模型”。
但今天,它仍然远远不是一个可以预测未来的水晶球。
人的行为会变,昨天支持的东西,半年以后可能反对。
经济环境变了、收入变了、朋友变了、新闻变了,一个人的选择都会发生变化。
数据如果不更新,AI 分身也会逐渐过期,而且越往复杂系统走,误差越容易放大。
一个消费者判断错 10%,和100万个消费者、竞争者、平台、政策同时互动以后判断错 10%,根本不是同一件事。
Simile 自己也提到:
模拟首先应该用来筛选假设和缩小测试范围,而不是直接取代真实世界实验;涉及重要决策时,真人研究和真实市场结果仍然应该是最终依据。
系统还需要不断用历史数据回测,一旦人群或环境变化,就重新校准。
另外还有一个更棘手的问题:谁拥有你的 AI 分身?
Park 在斯坦福阶段就提出,这种数字版本更像一个人的“数据肖像”,应该由被模拟的人拥有和控制。
研究团队也因此没有直接公开那1052个人的 Agent。
如果未来真的出现几亿人的 AI 分身库,授权范围、数据更新、删除权、用途边界都会成为这门生意绕不过去的问题。
07 AI 创业的价值正在往哪儿移动?
过去两年,大量 AI 产品都在解决同一类问题:
怎么更快地做东西。
更快写广告、更快做图片、更快做视频、更快写代码。
但当这些事情变得越来越便宜以后,会出现另外一个问题:你一天可以生成100条广告了。
然后呢?
以前做一条广告贵,所以生产是瓶颈。
现在100条广告几分钟就能做出来,瓶颈反而变成了:
到底应该投哪一条?
网站一天可以做20个版本,问题也就从“能不能做出来”,变成:
哪一个版本用户真的愿意用?
AI 可以一天给创业者想200个产品,更困难的问题却变成:
哪一个值得花六个月去做?
Simile 正好卡在这个变化上。
它不帮企业再生成第101个方案,它想卖的是:
在真正花钱以前,先判断前 100个方案里哪些更可能有效。
这可能会是接下来一类很有意思的 AI 生意。
不是继续帮助企业增加“产量”,而是在生成能力已经极度过剩以后,开始卖筛选、验证和试错成本。
而 Simile 的另一个启发,则在数据上。
它最重要的数据可能并不是“有40万个人”。
真正有价值的是:
这40万人的预测,能不能不断和真人后续的真实选择进行对照。
问卷只是数据。
“AI 预测他会选A,最后真人真的选了A”,才是训练一个行为模型更稀缺的数据。
所以如果 Simile 最后真的能建立壁垒,它的壁垒大概率也不会只是某一个更大的模型。
而会是这套循环:
找到真人、建立分身、预测行为、拿真实结果验证、找到偏差、重新校准,然后再预测下一次。
AI 生成内容的时代,数据告诉机器“世界是什么”;而如果行为模拟这条路线成立,下一类重要数据可能会变成:
机器猜完以后,人到底是怎么做的。
这也是为什么,我觉得 Simile 有意思的地方。
以上,祝你今天开心。
作者:张艾拉 公众号:Fun AI Everyday
本文由 @张艾拉 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
Aitishiku.com