证据与限制

评测方法与结果

以下信息直接取自随现役服务发布的能力边界与验证矩阵,避免另行维护一套可能过时的数字。

更新日期:

模型版本
20260820-011603
验证口径
v3 validation;生产口径:train 真人校准集定阈,alpha = 0.02;cross_source 指验证来源未出现在训练语料中
样本总数
2,800
测试日期
2026-08-20

现役模型的聚合结果

首页的测试准确率为 98.54%2,800 段测试文本中有 2,759 段判断正确,按实际文本数量计算,不是各场景百分比的简单平均。这是该批测试文本的结果,不保证任意文本都有相同准确率。

不同来源 AI 文本召回率
98.30%
同源人工文本误判率
0.56%
不同来源人工文本误判率
2.50%
最差已评测格误判率
5.00%英文文学 · en·literary

以上聚合结果与下方逐格数据来自同一份验证矩阵。误判率只统计人工文本样本不为零的格;无人工样本的组合保持未评测,不按零误判计入。

十二格完整验证矩阵

每格按来源关系、语言与文稿类型拆分,同时列出样本数与命中数,便于复算公开比率。

现役模型在验证集中的逐格召回率与误判率
来源关系语言类型人工文本误判率AI 文本召回率
同源中文学术0.00%0 / 150 条误判95.33%143 / 150 条识别
同源中文文学0.67%1 / 150 条误判100.00%150 / 150 条识别
同源中文自媒体1.33%2 / 150 条误判98.00%147 / 150 条识别
同源英文学术0.67%1 / 150 条误判96.67%145 / 150 条识别
同源英文文学0.00%0 / 150 条误判100.00%150 / 150 条识别
同源英文自媒体0.67%1 / 150 条误判99.33%149 / 150 条识别
不同来源中文学术未评测(人工样本 0 条)100.00%100 / 100 条识别
不同来源中文文学1.00%1 / 100 条误判100.00%100 / 100 条识别
不同来源中文自媒体4.00%4 / 100 条误判95.00%95 / 100 条识别
不同来源英文学术未评测(人工样本 0 条)99.00%99 / 100 条识别
不同来源英文文学5.00%5 / 100 条误判98.00%98 / 100 条识别
不同来源英文自媒体0.00%0 / 100 条误判98.00%98 / 100 条识别

评测对象与覆盖范围

验证矩阵覆盖中文和英文,以及学术、文学与自媒体三类文稿;每个场景再区分同源与不同来源。这里的“不同来源”表示验证文本来源没有出现在训练语料中。矩阵共计人工文本 1,300 条、AI 文本 1,500 条。

训练文本规模:19,004,936 个非空白字符,来自 47,183 段参与模型拟合的中英文文本。含标点,英文按字符而非单词计数;不含校准、验证或测试文本,也不是底层语言模型的预训练规模。

阈值如何确定?

生产阈值使用人工训练校准集确定,协议标识为 train-human-conformal-alpha-0.02; score > domain threshold。判定时,校准分数高于对应语言与领域的阈值,才记为偏离。阈值协议、模型版本和验证矩阵相互绑定;模型版本不匹配时,服务不会把这组指标作为现役结果发布。

指标如何阅读?

AI 文本召回率是实际 AI 文本中被识别为偏离的比例,数值越高越好;人工文本误判率是实际人工文本中被判为偏离的比例,数值越低越好。首页与检测页的完整矩阵从服务端能力声明读取,未评测项显示为空。

适用边界

当前模型经过验证的单段范围为中文 1101200 字符、英文 2802600 字符。超出范围的长文会按服务规则切分;极短片段、来源分布显著不同的文本、经过特殊改写的文本,以及矩阵中没有样本的组合,都不应从现有指标外推确定性结论。

查看首页现役模型实测说明