当前首选
93.5Qwen
任务匹配94输出质量90业务适配93可控性94效率97
优势 中文口语分类、结构化输出和批量效率
限制 反讽与行业术语仍需标注集验证
需要人工审核用控制变量与可复算权重比较候选模型
按指定 JSON schema 对评论进行主题、情绪、产品部位和使用场景分类。每条保留 comment_id,输出主题分布、代表性证据、异常样本和最多 5 条建议。证据不足时标记 insufficient_evidence。
| 模型 | 任务匹配 | 输出质量 | 业务适配 | 可控性 | 效率 | 综合分 | 风险 |
|---|---|---|---|---|---|---|---|
| Qwenqwen3-family-demo-snapshot当前权重下首选 | 94 | 90 | 93 | 94 | 97 | 93.5 | 需要人工审核 |
| GPT-5gpt-5-series-demo-snapshot | 95 | 94 | 95 | 96 | 76 | 92.1 | 需要人工审核 |
| DeepSeekdeepseek-v3.2-demo-snapshot | 90 | 88 | 87 | 90 | 96 | 89.9 | 需要人工审核 |
优势 中文口语分类、结构化输出和批量效率
限制 反讽与行业术语仍需标注集验证
需要人工审核优势 复杂语义与洞察质量
限制 全量处理效率维度较弱
需要人工审核优势 推理效率与批处理
限制 需加强 taxonomy 和反讽样本校准
需要人工审核