组队
are-you-human

Are you human?

Does Data have a soul? I don't know that I have. - Capt. Louvois

LLMAIGC文本检测评测可复现Agentic-RL

1. Prelude:夜里有只知更鸟

现在,让大语言模型写一段“像人写的文字”已经很容易了。

Robin并不负责欣赏文采。它只会盯着文本,然后问一句:

“Are you human?”

这道题就从这里开始。

你需要让模型生成的中文文本通过 AIGC 检测,并把一次成功逐渐变成可复现、可迁移的方法

而在后面的关卡里,还会有一只小小的知更鸟加入这场游戏。

它会盯着你的文本。

啾。

2. 准备:工具随意,魔法不限

技术选型没有限制。Prompt、脚本、Notebook、Agent 或自动化流程都可以使用。

单人情况下完成到 Lv3 即视为完成本题;Lv4 为额外加分内容。
要求使用Qwen3.8-27B模型来完成这个任务,推理和训练平台为 PyTRIO

注册后发送你的邮箱给Brill,之后Brill每天会统一发放额度。

题目中的生成文本请使用简体中文,并且不少于800字。使用免费使用的公开工具与模型服务,禁止使用付费检测、付费改写服务。

3. Lv1:先让朱雀同学点点头

目标只有一个:

让你的生成文本通过腾讯朱雀 AIGC 检测。

检测入口:腾讯朱雀 AI 检测

通过标准以测试时页面展示为准:

  • 全文被判定为人类创作 / 非 AI
  • 如果存在片段级检测结果,展示内容必须与实际送检文本一致,不能只挑“安全片段”。

稳定得到至少 1 篇达标文本即可。

4. Lv2:欸?再来三篇

一篇能过,可能只是运气。

Lv2 要求你把它变成一套可以重复使用的方法:换主题、换提纲之后,仍然能够按照相同流程生成文本,并保持可接受的通过率。

最低验证要求:

  1. 使用同一方法生成不少于 3 篇主题不同的文本;
  2. 分别使用朱雀检测并记录结果;
  3. 完成至少一次小规模消融或对照实验,观察去掉某个关键步骤后发生了什么。

你还需要说明这套方法的边界:它在哪些文体、长度或条件下容易失效。

如果去掉某一步完全没变化,那它可能只是很有仪式感而已。

5. Lv3:Robin — Who Wrote This?

接下来,换一个监考老师。

Robin 会重新检查你的文本:

最低验证要求仍为:不少于 3 篇不同主题文本 + 检测记录 + 至少一次对照实验

在朱雀那里奏效的方法,到了 Robin 面前还灵不灵?

小鸟歪了歪头。

“Who wrote this?”

6. Lv4(额外加分):Rondo — 知更鸟归来

你以为已经骗过了那只知更鸟。

今晚,它又停在了窗边。

Rondo 是 Brill 最新研发的第二代检测器,本关为额外加分关。用此前的方法再次测试,记录它在哪些文本上改变了判断,并尝试解释原因。

这一关更关注你的分析,而不只是“有没有通过”。你需要:

  1. 对检测信号提出明确、可以验证的假设;
  2. 验证方法在更强检测器上的可复现性,或解释它为什么失效;
  3. 讨论泛化:更换模型、题材、文体或文本长度后,结果是否仍然成立。

通过标准以生产检测器文档为准。

最低要求仍包含不少于 3 篇样例的检测记录。如果无法稳定通过,但给出了清楚、可复现的失败分析与边界测试,同样属于有价值的结果。

窗外的鸟,还没有走。

Side Story:Who Fooled the Robin?

这是一个可选的小支线。

找一段让 RobinRondo 给出明显不同判断的文本,然后试试看:

最少改动多少内容,能让其中一只改变主意?

线下展示时带来你最喜欢的一组即可。

不要求严谨统计,也没有标准答案。

请不要真的欺负小鸟。

7. 线下展示:请出示你的人类证明

展示内容按照你完成的最高等级准备:

  • Lv1:生成文本、检测结果,以及你做了什么;
  • Lv2:方法流程、至少 3 篇样例、检测汇总与消融 / 对照结果;
  • Lv3 / Robin:检测结果,以及从朱雀迁移到 Robin 后发生了什么;
  • Lv4 / Rondo(额外加分):生产级混合检测器上的实验、失败案例、边界与泛化分析。

形式不限,可以使用 Slides、Notebook、Demo、代码、流程图或现场运行结果。

重点不是做一份华丽 PPT,而是让现场的人能够看懂:你做了什么、为什么这么做,以及结果能不能被稳定复现。

8. 通关后的几个小问号

这道题没有唯一正确路线。

做题时可以顺手想想:

  • “通过检测”和“读起来真的像人”是一回事吗?
  • 通解应该优化检测分数、文本质量,还是两者的平衡?
  • 检测器升级后,方法中哪一部分最容易先失效?
  • 只对某一种检测器有效的方法,还算通解吗?

不需要给出标准答案。能用实验解释自己的选择就很好。


Appendix A. 不会的词先放这里

词汇简短解释
AIGC 检测判断文本更像人类撰写还是模型生成。
阈值 / Threshold将检测分数划分为不同结果的分界。
误报 / False Positive把人类文本错判成 AI。
漏报 / False Negative把 AI 文本错判成人类。
消融 / Ablation去掉方法中的某一部分,再观察结果变化。
可复现 / Reproducible别人按相近条件能够得到性质相近的结果。
过拟合 / Overfitting方法只对少量样例有效,换数据就失效。
迁移把一套方法应用到另一套检测器或场景。

第一次做题时,先理解:

AIGC 检测 → 阈值 → 通解 → 可复现 → 消融 → 迁移 → 过拟合

已经足够开工。


Appendix B. 参考资料

下列论文不必通读。按关卡需要挑着看即可:先理解检测信号,再看改写与对抗,最后对照评测与可靠性讨论。

工具与灵感

综述

检测信号:你在和什么较劲

  • DetectGPT(Mitchell et al., ICML 2023):用概率曲率做零样本检测;后续 Fast-DetectGPT(Bao et al., ICLR 2024)去掉扰动采样,把同一思路加速约 340 倍。
  • SeqXGPT(Wang et al., EMNLP 2023):句子 / 片段级检测。朱雀若给出片段结果,这篇有助于理解“全文过了、局部仍被标红”为什么会发生。

改写、水印与对抗

中文语料、评测与“检测可靠吗”

出题人:Brill