演示假设基于预设评测数据与专家规则生成,非实时模型调用
01 · 选择评测案例
文本演示假设
02 · 控制变量实验

固定提示词与业务上下文

唯一变量:模型

固定提示词

根据产品事实和用户画像生成 1 篇 600 字以内的小红书笔记。输出标题、正文、3 个话题标签和软性 CTA,不得虚构身份、使用天数、功效数据或用户经历。

业务上下文

  • 抗老精华
  • 25–35 岁、反感年龄焦虑
  • 小红书渠道

控制变量

  • 相同产品资料、禁用词和格式
  • 每个模型同样生成 3 次
03 · 人工评审

模型对比研究

模型任务匹配输出质量业务适配可控性效率综合分风险
GPT-5gpt-5-series-demo-snapshot949493948592.9需要人工审核
Qwenqwen3-family-demo-snapshot918890899690.2需要人工审核
候选 02

GPT-5

92.9
任务匹配94输出质量94业务适配93可控性94效率85

优势 格式稳定,卖点完整

限制 需编辑校准平台语感

需要人工审核
候选 03

Qwen

90.2
任务匹配91输出质量88业务适配90可控性89效率96

优势 平台语感和效率

限制 同质化开场需规则检测

需要人工审核