海军联邦信用合作社合成数据试点项目的发现
海军联邦信用合作社与Qualtrics合作开展合成数据试点,测试其与真人受访者数据的相似度与差异,发现合成数据在理性判断和减少偏差方面表现良好,但在情感和同理心方面仍有不足。

现役军人事务繁忙,鲜有空闲时间,更不愿将宝贵的闲暇用于填写调查问卷。这对海军联邦信用合作社(Navy Federal Credit Union)研究战略助理副总裁凯瑟琳·迈尔斯(Kathleen Myers)而言,是一个现实难题。这家由会员所有、非营利的信用合作社专门服务军人、退伍军人及其家属,必须依靠会员反馈来精准满足其需求。
对于研究团队而言,合成数据——即由人工智能生成、旨在模拟真实世界的数据——成为触达难以覆盖人群的一种颇具吸引力的替代方案。研究团队已在应用合成数据,且兴趣与日俱增。Qualtrics发现,41%的市场研究者目前正使用合成数据来补充或替代真人受访者,62%的受访者表示有意使用。
“现役军人极难触达——他们几乎没有空闲时间,”迈尔斯对CX Dive表示,“一旦确信背后的模型已得到恰当调校,就能将其用于快速反馈或更大规模的反馈,我认为这对我们而言是巨大的机遇。”
该信用合作社与Qualtrics合作开展了一个试点项目,旨在了解合成数据相较于第三方真人样本的表现。“我们的意图是真正地测试和学习,而非得出用于决策的硬性KPI,”迈尔斯说,“这本质上是关于创新的探索。”
合成数据具有诸多优势——可节省时间、减少偏差、降低成本。但该技术是否已成熟到可大规模应用,在专家中仍存争议。对迈尔斯而言,关键在于合成数据的用途。“必须审慎地选择使用场景,”迈尔斯说,“我们发现合成数据非常擅长做出理性判断,回答功能导向的问题。一旦涉及情感,情况就变得棘手。”
试点发现:理性有余,情感不足
海军联邦与Qualtrics利用合成数据测试了普通人群对信任和金融服务(针对潜在信用卡套餐)的态度。尽管该金融机构看到了合成数据在军人群体中的潜在价值,但首次测试仍采取了更广泛的视角。
试点旨在确定传统回答与合成回答之间的相似程度、差异领域、时间与成本节省情况,以及是否(以及多久)能得出相同的决策。海军联邦提供了一份调查问卷,并与Qualtrics共同审阅和修订。随后,Qualtrics将问卷发放给501名传统第三方样本成员,并据此建模生成了498份合成回答。
在所有问题上,人类与合成回答看似一致。两组平均分差异在0.25%以内。但差异依然存在:合成回答更倾向于高估效率或财务收益,却低估对同理心的需求。
另一方面,Qualtrics发现合成数据可减少人类偏差。李克特量表问题(即询问同意程度的问题)往往存在默许偏差,人类无论是否真正同意,都更倾向于同意陈述。人类还易受社会期望偏差影响,更可能回避承认风险行为。合成回答则提供了更多差异化的回应。
人类表示不愿申请信用卡,担心被拒
在试点中,合成和人类都被问及对“我因可能被拒绝而不愿申请(额外)信用卡”这一陈述的同意程度。此类问题很可能同时受到默许偏差和社会期望偏差的影响。海军联邦观察到回答存在20个百分点的差距:41%的人类受访者表示同意,而合成回答中仅21%同意。
“合成数据在‘社会满足’方面的偏差更小,”迈尔斯说,“它们更可能诚实回答,没有羞耻或尴尬感,因此在敏感话题上可能获得非常坦率的答案。”
合成数据的挑战:情感与直觉的缺失
人类并非总是理性的,他们受情感和冲动驱使。这正是合成回答有时难以企及之处。尽管合成数据在减少偏差方面表现良好,但在模拟人类情感及其对行为的影响上,准确性不足。
以试点调查中对各行业信任度的回答为例:合成回答更倾向于信任所有行业,而人类则在不同行业间表现出更明显的辨别力。另一个差异显著的领域是消费者担忧。合成回答更可能将网络犯罪列为头号消费者担忧,24%的合成回答选择此项,而人类受访者中仅6%。然而,合成回答更贴近皮尤研究中心的研究——该研究显示约五分之一的成年人曾因网络诈骗或攻击而蒙受损失。
合成数据提供逻辑回答,但低估情感因素
迈尔斯指出,合成回答偏向效率或财务收益,却低估了情感因素。“我们观察到,合成数据对问题会提供更理性的回答,能逻辑有效地处理功能权衡,”迈尔斯说。
贝恩公司(Bain & Company)客户战略与营销业务成员安迪·皮尔斯(Andy Pierce)也观察到类似现象。“我们发现LLM高度理性,例如,若训练一个LLM并让其权衡价格与功能,会得到价格与质量或价格与数量之间的线性关系,”皮尔斯说,他同时担任贝恩价值主张创新与设计全球负责人。LLM遵循“越多越好”或“越便宜越好”的原则,但LLM可以学习。
“通过巧妙的提示工程以及引入其他类型的数据,我们实际上已学会训练LLM,使其变得更富同理心,并逐渐理解品牌等高度情感化、在人类行为中看似非理性的因素,也能在合成世界的LLM中得到反映,”皮尔斯说。
此外,若无适当护栏,基于合成数据采取行动也存在风险。例如,Forrester预计今年至少会发生两起重大丑闻,源于企业基于AI主导的客户研究采取行动,因为超负荷的客户体验团队依赖合成受众和AI主持访谈等应用。该分析机构敦促领导者借助专业研究来压力测试AI生成的洞察。
何时使用合成数据:决策框架
随着对合成数据的兴趣增长,品牌需要决定如何及何时使用。专家指出,合成回答可克服的障碍包括:难以触达的受众、调查疲劳、昂贵且耗时的调查。“我认为它非常适合低发生率受众,即那些难以在茫茫人海中找到的群体,”迈尔斯说。
它也有助于减少调查疲劳——合成数据不会因回答冗长问卷而疲倦。在速度和规模方面,合成回答具有优势,但在该过程中的某个节点,必须纳入“人类以获取深度和细微差别”,迈尔斯说。简言之,“广度来自合成,深度来自人类”。
涉及人类情感的问题,仍更宜采用真人样本。“目前,如果我们知道调查领域涉及情感和自我认同,例如与品牌相关、涉及忠诚度或审美偏好,那么真人受访者可能更合适,”迈尔斯说。
合成研究的速度是其最大吸引力之一。据Qualtrics称,传统样本需五天,而合成数据在四小时内即可收集并清洗完毕。“你可能因追求快速上市而这样做,某些情况下,通过传统调查方法需数月收集的数据,若使用合成来源或合成焦点小组,可在数天或数小时内获得,”高德纳(Gartner)分析师利兹·福·库恩(Lizzy Foo Kune)表示。
高德纳与一家制药公司的研究发现,传统调查成本可能约为9万美元,而合成版本仅约2万美元,且“结果类型相同”,库恩说。尽管用合成数据替代真人调查颇具诱惑,但库恩和其他分析师并不建议这样做。“我们告诉客户,合成数据目前应补充而非替代真实世界数据,因为它仍处于早期阶段,”库恩说。
展望未来,迈尔斯已看到潜在用例。当营销团队最近要求海军联邦研究团队对20条不同价值主张提供消费者反馈时,她认为合成研究是一种可能。“我们能否先用合成数据测试这20条信息陈述?”迈尔斯说,“对于优先级排序练习,这正是我最兴奋之处——能快速筛选大列表,获得第一层反馈。”
海军联邦识别的另一个用例是预设计阶段,即“预发布前”,迈尔斯说。“因此,在设计问卷时,我是否在问正确的问题?这些问题是否传达了我认为的含义?是否有令人困惑的部分?”她说,“可先利用合成数据获得此类反馈,再将其投放给真人。”