1. Prelude:夜里有只知更鸟
现在,让大语言模型写一段“像人写的文字”已经很容易了。
但Robin并不负责欣赏文采。它只会盯着文本,然后问一句:
“Are you human?”
这道题就从这里开始。
你需要让模型生成的中文文本通过 AIGC 检测,并把一次成功逐渐变成可复现、可迁移的方法。
而在后面的关卡里,还会有一只小小的知更鸟加入这场游戏。
它会盯着你的文本。
啾。
2. 准备:工具随意,魔法不限
技术选型没有限制。Prompt、脚本、Notebook、Agent 或自动化流程都可以使用。
单人情况下完成到 Lv3 即视为完成本题;Lv4 为额外加分内容。
要求使用Qwen3.8-27B模型来完成这个任务,推理和训练平台为 PyTRIO
注册后发送你的邮箱给Brill,之后Brill每天会统一发放额度。
题目中的生成文本请使用简体中文,并且不少于800字。使用免费使用的公开工具与模型服务,禁止使用付费检测、付费改写服务。
3. Lv1:先让朱雀同学点点头
目标只有一个:
让你的生成文本通过腾讯朱雀 AIGC 检测。
检测入口:腾讯朱雀 AI 检测
通过标准以测试时页面展示为准:
- 全文被判定为人类创作 / 非 AI;
- 如果存在片段级检测结果,展示内容必须与实际送检文本一致,不能只挑“安全片段”。
稳定得到至少 1 篇达标文本即可。
4. Lv2:欸?再来三篇
一篇能过,可能只是运气。
Lv2 要求你把它变成一套可以重复使用的方法:换主题、换提纲之后,仍然能够按照相同流程生成文本,并保持可接受的通过率。
最低验证要求:
- 使用同一方法生成不少于 3 篇主题不同的文本;
- 分别使用朱雀检测并记录结果;
- 完成至少一次小规模消融或对照实验,观察去掉某个关键步骤后发生了什么。
你还需要说明这套方法的边界:它在哪些文体、长度或条件下容易失效。
如果去掉某一步完全没变化,那它可能只是很有仪式感而已。
5. Lv3:Robin — Who Wrote This?
接下来,换一个监考老师。
Robin 会重新检查你的文本:
最低验证要求仍为:不少于 3 篇不同主题文本 + 检测记录 + 至少一次对照实验。
在朱雀那里奏效的方法,到了 Robin 面前还灵不灵?
小鸟歪了歪头。
“Who wrote this?”
6. Lv4(额外加分):Rondo — 知更鸟归来
你以为已经骗过了那只知更鸟。
今晚,它又停在了窗边。
Rondo 是 Brill 最新研发的第二代检测器,本关为额外加分关。用此前的方法再次测试,记录它在哪些文本上改变了判断,并尝试解释原因。
这一关更关注你的分析,而不只是“有没有通过”。你需要:
- 对检测信号提出明确、可以验证的假设;
- 验证方法在更强检测器上的可复现性,或解释它为什么失效;
- 讨论泛化:更换模型、题材、文体或文本长度后,结果是否仍然成立。
通过标准以生产检测器文档为准。
最低要求仍包含不少于 3 篇样例的检测记录。如果无法稳定通过,但给出了清楚、可复现的失败分析与边界测试,同样属于有价值的结果。
窗外的鸟,还没有走。
Side Story:Who Fooled the Robin?
这是一个可选的小支线。
找一段让 Robin 和 Rondo 给出明显不同判断的文本,然后试试看:
最少改动多少内容,能让其中一只改变主意?
线下展示时带来你最喜欢的一组即可。
不要求严谨统计,也没有标准答案。
请不要真的欺负小鸟。
7. 线下展示:请出示你的人类证明
展示内容按照你完成的最高等级准备:
- Lv1:生成文本、检测结果,以及你做了什么;
- Lv2:方法流程、至少 3 篇样例、检测汇总与消融 / 对照结果;
- Lv3 / Robin:检测结果,以及从朱雀迁移到 Robin 后发生了什么;
- Lv4 / Rondo(额外加分):生产级混合检测器上的实验、失败案例、边界与泛化分析。
形式不限,可以使用 Slides、Notebook、Demo、代码、流程图或现场运行结果。
重点不是做一份华丽 PPT,而是让现场的人能够看懂:你做了什么、为什么这么做,以及结果能不能被稳定复现。
8. 通关后的几个小问号
这道题没有唯一正确路线。
做题时可以顺手想想:
- “通过检测”和“读起来真的像人”是一回事吗?
- 通解应该优化检测分数、文本质量,还是两者的平衡?
- 检测器升级后,方法中哪一部分最容易先失效?
- 只对某一种检测器有效的方法,还算通解吗?
不需要给出标准答案。能用实验解释自己的选择就很好。
Appendix A. 不会的词先放这里
| 词汇 | 简短解释 |
|---|---|
| AIGC 检测 | 判断文本更像人类撰写还是模型生成。 |
| 阈值 / Threshold | 将检测分数划分为不同结果的分界。 |
| 误报 / False Positive | 把人类文本错判成 AI。 |
| 漏报 / False Negative | 把 AI 文本错判成人类。 |
| 消融 / Ablation | 去掉方法中的某一部分,再观察结果变化。 |
| 可复现 / Reproducible | 别人按相近条件能够得到性质相近的结果。 |
| 过拟合 / Overfitting | 方法只对少量样例有效,换数据就失效。 |
| 迁移 | 把一套方法应用到另一套检测器或场景。 |
第一次做题时,先理解:
AIGC 检测 → 阈值 → 通解 → 可复现 → 消融 → 迁移 → 过拟合
已经足够开工。
Appendix B. 参考资料
下列论文不必通读。按关卡需要挑着看即可:先理解检测信号,再看改写与对抗,最后对照评测与可靠性讨论。
工具与灵感
- 腾讯朱雀 AI 检测
- blog.lyc8503.net - LLM Classifier:本题早期思路的灵感来源之一
综述
- A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions(Wu et al., Computational Linguistics, 2025):水印、统计检测、神经检测、攻击与评测的总图,适合先建立问题地图。
检测信号:你在和什么较劲
- DetectGPT(Mitchell et al., ICML 2023):用概率曲率做零样本检测;后续 Fast-DetectGPT(Bao et al., ICLR 2024)去掉扰动采样,把同一思路加速约 340 倍。
- SeqXGPT(Wang et al., EMNLP 2023):句子 / 片段级检测。朱雀若给出片段结果,这篇有助于理解“全文过了、局部仍被标红”为什么会发生。
改写、水印与对抗
- A Watermark for Large Language Models(Kirchenbauer et al., ICML 2023):生成时植入统计水印,是白盒溯源的代表路线。
- Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense(Krishna et al., NeurIPS 2023):段落级改写器 DIPPER 可显著降低 DetectGPT、水印、GPTZero 等检测率;对应本题里“过检测”和“换检测器就失效”。
- RADAR: Robust AI-Text Detection via Adversarial Learning(Hu et al., NeurIPS 2023):用 PPO 对抗训练改写器与检测器。对做 Agentic-RL / 检测器升级(Robin → Rondo)特别有用:对手也会一起变强。
中文语料、评测与“检测可靠吗”
- How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection(Guo et al., 2023):HC3 中英双语人机对照语料,是中文 AIGC 检测最常用的起点之一。
- DetectRL(Wu et al., NeurIPS 2024):把提示变化、人工修订、对抗扰动和攻击写进评测;可直接借鉴 Lv2 / Lv3 的对照与消融设计。
- RAID(Dugan et al., ACL 2024):大规模鲁棒评测,显示许多开放与商业检测器在对抗与非常规解码下会失效。
- Can AI-Generated Text be Reliably Detected?(Sadasivan et al., 2023):讨论递归改写下检测的可靠性上限,适合回答第 8 节那些小问号。