证据与限制
评测方法与结果
以下信息直接取自随现役服务发布的能力边界与验证矩阵,避免另行维护一套可能过时的数字。更新日期:
- 模型版本
- 20260820-011603
- 验证口径
- v3 validation;生产口径:train 真人校准集定阈,alpha = 0.02;cross_source 指验证来源未出现在训练语料中
- 样本总数
- 2,800 条
- 测试日期
- 2026-08-20
现役模型的聚合结果
首页的测试准确率为 98.54%:2,800 段测试文本中有 2,759 段判断正确,按实际文本数量计算,不是各场景百分比的简单平均。这是该批测试文本的结果,不保证任意文本都有相同准确率。
- 不同来源 AI 文本召回率
- 98.30%
- 同源人工文本误判率
- 0.56%
- 不同来源人工文本误判率
- 2.50%
- 最差已评测格误判率
- 5.00%英文文学 ·
en·literary
以上聚合结果与下方逐格数据来自同一份验证矩阵。误判率只统计人工文本样本不为零的格;无人工样本的组合保持未评测,不按零误判计入。
十二格完整验证矩阵
每格按来源关系、语言与文稿类型拆分,同时列出样本数与命中数,便于复算公开比率。
| 来源关系 | 语言 | 类型 | 人工文本误判率 | AI 文本召回率 |
|---|---|---|---|---|
| 同源 | 中文 | 学术 | 0.00%0 / 150 条误判 | 95.33%143 / 150 条识别 |
| 同源 | 中文 | 文学 | 0.67%1 / 150 条误判 | 100.00%150 / 150 条识别 |
| 同源 | 中文 | 自媒体 | 1.33%2 / 150 条误判 | 98.00%147 / 150 条识别 |
| 同源 | 英文 | 学术 | 0.67%1 / 150 条误判 | 96.67%145 / 150 条识别 |
| 同源 | 英文 | 文学 | 0.00%0 / 150 条误判 | 100.00%150 / 150 条识别 |
| 同源 | 英文 | 自媒体 | 0.67%1 / 150 条误判 | 99.33%149 / 150 条识别 |
| 不同来源 | 中文 | 学术 | 未评测(人工样本 0 条) | 100.00%100 / 100 条识别 |
| 不同来源 | 中文 | 文学 | 1.00%1 / 100 条误判 | 100.00%100 / 100 条识别 |
| 不同来源 | 中文 | 自媒体 | 4.00%4 / 100 条误判 | 95.00%95 / 100 条识别 |
| 不同来源 | 英文 | 学术 | 未评测(人工样本 0 条) | 99.00%99 / 100 条识别 |
| 不同来源 | 英文 | 文学 | 5.00%5 / 100 条误判 | 98.00%98 / 100 条识别 |
| 不同来源 | 英文 | 自媒体 | 0.00%0 / 100 条误判 | 98.00%98 / 100 条识别 |
评测对象与覆盖范围
验证矩阵覆盖中文和英文,以及学术、文学与自媒体三类文稿;每个场景再区分同源与不同来源。这里的“不同来源”表示验证文本来源没有出现在训练语料中。矩阵共计人工文本 1,300 条、AI 文本 1,500 条。
训练文本规模:19,004,936 个非空白字符,来自 47,183 段参与模型拟合的中英文文本。含标点,英文按字符而非单词计数;不含校准、验证或测试文本,也不是底层语言模型的预训练规模。
阈值如何确定?
生产阈值使用人工训练校准集确定,协议标识为 train-human-conformal-alpha-0.02; score > domain threshold。判定时,校准分数高于对应语言与领域的阈值,才记为偏离。阈值协议、模型版本和验证矩阵相互绑定;模型版本不匹配时,服务不会把这组指标作为现役结果发布。
指标如何阅读?
AI 文本召回率是实际 AI 文本中被识别为偏离的比例,数值越高越好;人工文本误判率是实际人工文本中被判为偏离的比例,数值越低越好。首页与检测页的完整矩阵从服务端能力声明读取,未评测项显示为空。
适用边界
当前模型经过验证的单段范围为中文 110–1200 字符、英文 280–2600 字符。超出范围的长文会按服务规则切分;极短片段、来源分布显著不同的文本、经过特殊改写的文本,以及矩阵中没有样本的组合,都不应从现有指标外推确定性结论。