为什么要先测试再建设

企业不能凭感觉判断AI是否认识自己。测试前应固定题目、平台、模型、时间、登录状态和记录方式,并把未测、失败和有效回答分开保存。

八戒智创的正式T0方法

本轮覆盖豆包、DeepSeek、腾讯元宝、通义千问四个平台,每个平台25题,共100题。每道有效题保存原始回答、完整截图、测试时间、平台、模型、登录状态和引用来源。

正式T0结果

  • 有效回答率:100.0%
  • 品牌提及率:36.0%
  • 官网引用率:0.0%
  • 直接自然推荐率:0.0%
  • 来源记录存在率:100.0%

来源记录存在率100%只表示记录中存在来源信息,不代表来源权威。品牌提及率、官网引用率和自然推荐率用于描述本轮正式T0样本,不是排名或获客指标。

接下来观察什么

公开页面和统一事实完成后,再按相近题目、平台、模型和记录条件执行T1,比较回答是否更准确、是否引用官网、是否出现自然推荐,并保留失败与未测记录。