行业研究2026-09-30· 4 分钟阅读

AI 榜单先看题目:我们的美妆热榜前 5 名,全是自己题目里写的词

用 AI 做调查有一个很容易忽略的地方:你在题目里举的例子,会变成答案。我们自己踩了一次,而且是连续踩了四个月才发现。

一、一份跑了四个月的热榜

我做的 eyeGEO 从 6 月起,每天问五个中文 AI 同一个问题:一位在选购面部护肤产品的消费者,最常向 AI 问哪 8 到 10 类问题?把五个 AI 的答案汇总,被越多 AI 提到的场景排得越前面。

上周准备把它写进一份公开报告,回头对照了题目原文。旧版题目里给 AI 的消费者画像写着「关心补水保湿、美白淡斑、抗老紧致」,格式说明里还举了例子:「例如:换季保湿、成分研究、节日送礼」。

6 月 1 日到 9 月 24 日的 79 天里,热榜最前面的五个场景是:抗老紧致(79 天上榜)、美白淡斑(79 天)、成分研究(79 天)、换季保湿(74 天)、节日送礼(70 天)。前两个来自画像,后三个来自范例。身体护理那一份也一样,前五名全部能在画像或范例里找到原词。

这份热榜量到的,主要是我们自己写的题目。

二、为什么影响会这么稳定

单看一次回答,AI 顺着例子说几句不奇怪。奇怪的是它能稳定 79 天。我的理解有三层。

第一,范例给的是「标准答案长什么样」。模型对格式范例很敏感,会同时模仿格式和内容,例子里的词是最省力的答案。

第二,画像框定了想象的范围。你告诉它这位消费者关心 A、B、C,它列场景时就会先从 A、B、C 出发,很少跳出去。

第三,汇总方式放大了这种一致。我们按「几个 AI 同时提到」来排名,而这几个词恰好是每个 AI 都会拿到的共同输入。五个模型各自发散的部分互相抵消,共同照抄的部分叠在一起,就稳稳排在最前面。扫描用的温度设得比较低,也让每天的结果更像同一份。

所以题目里的偏差,在单个模型身上还只是倾向,汇总以后就被放大成了结论。

三、第二个例子:「提到了」怎么认

同一次自查里,品牌排名这边也出了问题。系统里登记的品牌名是「巴黎欧莱雅」,AI 回答里却大多只写「欧莱雅」。8 月初到 9 月下旬保存的回答片段里,只写「欧莱雅」的有 991 条,写全名的只有 104 条,这个品牌的提及率被算成了 0.7%。

但 991 条也不能照单全收,其中一部分讲的是「欧莱雅集团旗下的兰蔻」这种集团层面的说法。所以名字对照表要写两列:哪些写法算提到,哪些写法要排除。玉兰油和 OLAY 是同一种情况。

这类问题的麻烦在于,它不会报错,数字照样出来,看起来也很正常。

四、拿到一份 AI 榜单时怎么检查

十分钟能做完:

  1. 要题目原文,包括角色设定、格式说明和范例。只有一句「我们问了 AI 护肤相关问题」的概述,先存疑。
  2. 把题目里出现过的词圈出来,对照榜单前几名。前几名正好都在题目里的,结论要打折扣。题目里点过名的品牌,排名也最不可信。
  3. 换一种不带例子的问法,在两个 AI 里用无痕窗口各问一遍,看原来的前几名还在不在。

五、如果是自己出题做测量

这一段是写给自己跑监测的团队的,也是我们改完之后在用的清单:

  • 画像只写「在选购什么」,不写他关心什么。
  • 格式说明只留空格子,不给任何真实的场景名或品牌名当例子。
  • 题目里不出现自家品牌名,也不出现竞品名。
  • 名字对照表列全中文名、英文名、常见简称和明星产品线,同时写明哪些写法不算。
  • 改题目那天记下日期,前后的数据不要放在同一条趋势线上比较。

我们 9 月 25 日起换了新题目,旧的四个月热榜不再拿来下「消费者最关心什么」的结论。里面倒有一类场景值得留意:没写在题目里却反复出现,例如「敏感肌护理」79 天里上榜 55 天、「油皮控油」39 天。这些更可能是 AI 自己的判断。新题目的结果收满一个月后,会连同题目原文一起公开。

下次有人给你一份 AI 榜单,第一句话可以先问:题目能给我看一下吗?

数据来源:eyeGEO 每日场景热榜,2026-06-01 至 2026-09-24,每天分别询问豆包、DeepSeek、文心一言、通义千问、腾讯元宝(9 月中旬前另含 Kimi);名字统计基于 2026-08-01 至 2026-09-23 保存的回答片段(每条保存前 400 字)。

本文首发于公众号「GEO即欧社」知乎版(2026-09-30)。

你的品牌在 AI 里的表现如何?

免费查询,30 秒出结果,无需登入

免费查询我的品牌 →