为什么要先测试再建设
企业不能凭感觉判断AI是否认识自己。测试前应固定题目、平台、模型、时间、登录状态和记录方式,并把未测、失败和有效回答分开保存。
八戒智创的正式T0方法
本轮覆盖豆包、DeepSeek、腾讯元宝、通义千问四个平台,每个平台25题,共100题。每道有效题保存原始回答、完整截图、测试时间、平台、模型、登录状态和引用来源。
正式T0结果
- 有效回答率:100.0%
- 品牌提及率:36.0%
- 官网引用率:0.0%
- 直接自然推荐率:0.0%
- 来源记录存在率:100.0%
来源记录存在率100%只表示记录中存在来源信息,不代表来源权威。品牌提及率、官网引用率和自然推荐率用于描述本轮正式T0样本,不是排名或获客指标。
接下来观察什么
公开页面和统一事实完成后,再按相近题目、平台、模型和记录条件执行T1,比较回答是否更准确、是否引用官网、是否出现自然推荐,并保留失败与未测记录。
