ICML2026.AIGC检测论文解读.Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence

论文基本信息



- 标题: Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence
- 作者: Shuangyi Chen, Ashish Khisti(多伦多大学)
- 发表: ICML 2026(国际机器学习会议)
- 论文链接:https://arxiv.org/abs/2510.07500
- 开源代码仓库: https://github.com/shuangyichen/SurpMark

论文原理



论文提出了一种名为SurpMark的AI文本内容检测方法。SurpMark解决了黑盒环境下机器生成文本检测的两个主要问题:

- 评分模型(代理LM)可能与未知源模型不匹配
- 现有的黑盒检测方法成本高昂

核心方法/概念 - Token Surprise Dynamics



1. Token Surprisal(惊喜度)分析
- 利用token级别的惊喜度动态变化来表征文本
- 惊喜度反映token在给定上下文中的意外程度
2. 量化离散化
- 将连续的惊喜度值量化为可解释的离散状态
- 提供了 principled 的离散化准则
3. 状态转移矩阵
- 为测试文本估计状态转移矩阵
- 捕捉惊喜度状态的动态转换模式
4. 广义Jensen-Shannon散度(GJS)
- 计算测试文本转移矩阵与两个固定参考(人类 vs 机器)之间的GJS间隙
- 参考矩阵从历史语料库一次性构建

核心创新点



1. 参考基准检测器
- 使用固定的参考矩阵,无需对每个输入进行对比生成
- 显著降低了计算成本
- 有更高的检测准确率


2. Token Surprisal Dynamics
- 首次使用惊喜度动态变化来检测AI生成文本
- 比静态特征更具区分性
3. 广义Jensen-Shannon散度
- 提供了理论上合理的距离度量
- 建立了决策统计量的渐近正态性
4. 黑盒鲁棒性
- 在评分模型与源模型不匹配的情况下仍然有效
- 实用性强,适用于真实场景

算法流程





整体架构流程图:


GJS间隙计算流程图:



Token Surprisal(惊喜度)计算公式



📝 基本定义

根据论文,Token Surprisal 是衡量一个token在给定上下文中"意外程度"的指标,其计算公式为:

s_t = -log p_θ(x_t | x_{1:t-1})

🔍 公式详解

符号说明:

- s_t : 第t个token的surprisal值
- p_θ : 代理模型 F_θ 估计的条件概率分布
- x_t : 第t个token
- x_{1:t-1} : 前t-1个token的上下文序列
- log : 对数(论文中使用自然对数)

数学含义:

- 低surprisal值 → token在当前上下文中很可预测(模型认为这很正常)
- 高surprisal值 → token在当前上下文中很意外/惊喜(模型觉得不寻常)

📊 完整计算流程

根据论文Algorithm 1,SurpMark的具体计算步骤为:

1.对每个文本进行tokenization
x_1:N = tokenize(text)

1. 计算每个token的surprisal
for t in range(1, N+1):
s_t = -log p_θ(x_t | x_{1:t-1})