演示假设基于预设评测数据与专家规则生成,非实时模型调用
01 · 选择评测案例
数据分析演示假设
02 · 控制变量实验

固定提示词与业务上下文

唯一变量:模型

固定提示词

按指定 JSON schema 对评论进行主题、情绪、产品部位和使用场景分类。每条保留 comment_id,输出主题分布、代表性证据、异常样本和最多 5 条建议。证据不足时标记 insufficient_evidence。

业务上下文

  • 500 条脱敏中文评论
  • 100 条人工验证集
  • 洞察需引用 comment_id

控制变量

  • 相同清洗数据、schema、批次和 few-shot 示例
  • 同一人工验证集和盲评 rubric
03 · 人工评审

模型对比研究

模型任务匹配输出质量业务适配可控性效率综合分风险
GPT-5gpt-5-series-demo-snapshot959495967692.1需要人工审核
DeepSeekdeepseek-v3.2-demo-snapshot908887909689.9需要人工审核
候选 02

GPT-5

92.1
任务匹配95输出质量94业务适配95可控性96效率76

优势 复杂语义与洞察质量

限制 全量处理效率维度较弱

需要人工审核
候选 03

DeepSeek

89.9
任务匹配90输出质量88业务适配87可控性90效率96

优势 推理效率与批处理

限制 需加强 taxonomy 和反讽样本校准

需要人工审核