主持人将此节目标记为"明确内容"。
显然,我需要介绍为什么我是解释这个概念的最佳人选,以及我如何进行研究。
之后,我深入该节目的核心:研究。
识别AI生成文本的终极指南,每位作家都需要阅读。
这个标题已经有两个线索:
- 标题大小写每个单词大写,这方便不出来口语化
- 夸张一个十分钟播客的终极承诺
在这一集的大部分时间里,我不是我自己,我是机器,我说的每一句话都是所描述的事物的例子。这个页面是节目那一部分的关键:按照你听到的顺序告诉你那些“告诉”,以及它们在录音中的听感。
大多数名字来自 tropes.fyi 所以你可以在那里查找它们,得到更详细的解释。
正如播客中提到的,这些不是错误。它们是人类作家几个世纪来使用的普通修辞手法。关键在于密度。
第一部分:词汇
- 尊严词汇没有人出声说的词。例如:深入(delve)、利用(harness)、运用(utilise)、稳健(robust)、促进(foster)
- 伟大的名词描述平凡的事物例如:织锦(tapestry)、景观(landscape)、领域(realm)、生态系统(ecosystem)、范式(paradigm)
- 魔法副词暗示重要性,却不提供信息。例如:安静地(quietly)、根本上(fundamentally)、有争议地(arguably)、令人惊讶地(remarkably)
- 避免使用“是”这个动词简单直接的“是”被替换为听起来更忙碌的表达。例如:作为(serves as)、作为标志(stands as)、代表(represents)、标记(marks)
- 发明的概念标签抽象问题名词(陷阱、渗透、悖论、反转)与领域词结合,然后像一个既定事实一样使用。例如:“流利陷阱”、“声誉渗透”。
- 模糊的归因没有姓名的权威。例如:“专家一致认为”,“行业报告显示”,“观察者指出”
- 诉诸熟悉感声称共识而非证明。例如:“经典的”、“著名的”、“我们都知道的”
- 推广语境描述变成销售。例如:“解锁”、“无缝”、“前所未有”
第二部分:句子形状
- 负面并列:“不是X,而是Y”的模式,最常见的是。例如:“这不是一种风格上的怪癖,而是结构上的标志。”
- 不是X。不是Y。只是Z。:“三倍的同一动作”,增加了紧张感,但其实没有必要。例如:“不是习惯。不是神经质。这是线索。”
- 三元组:“一个三元组优雅,但连续三个就像是针被卡住了。”例如:“它以三元组的形式出现,落在三元组上,然后以三元组的形式结束。”
- 短而有力片段:“通过句号制造强调,而不是通过内容获得强调。”例如:“短。平行。无情。”
- 自我回答的问题它问的是没有人问的问题,然后立即回答。例如:“问题是什么?没有人问。”
- 反复相同的句子开头,直到成为家具。例如:“他们以相同的方式开头句子。他们以相同的方式开头下一个句子。”
- 后缀“-ing”分析浅薄的意义被钉在完成后的句子上。例如:“强调其持久的重要性”,“反映更广泛的趋势”
- 虚假范围从X到Y”,其中没有尺度和中间值。例如:“从下水道到引用
- 填充过渡连接无到无
- 感叹词反射每个句子被切成两半,无论标点符号。
- 逗号剪尾短语挂在逗号上,而不是落在句点之后。
第三部分:语气
- 制造悬念积累到位,揭示却未到。
- 傲慢的比喻教师模式,未邀请。
- 强行使用比喻语言一个为了聪明而缺乏清晰度的隐喻。
- 夸大其词所有事情都是历史性的。
- 假装脆弱。诚实执行,永不冒险。
- 以断言代替证据。历史在此点上无可争议,证据清晰。
- 想象一个世界...未来主义销售口号,如果接受前提,就会有美好的结果。
- 引人深思的金句。滑动诱饵,因为它从未被从上下文中提取,因为它本无上下文。
- 协作的“我们”。我们将逐一解读它们。
- 讨好行为。这不是修辞手法,而是训练产物,识别原始聊天机器人输出的最快方法。
第四部分:格式
- 标题大小写标题请参阅本页顶部。
- 在需要时使用项目符号列表,而不是段落。文件将变成幻灯片演示文稿。
- **每个项目以加粗关键词和冒号开头**:每项任务都清晰明确,像一个引人入胜的故事。**使用表情符号作为标点符号**:🚀 追求梦想,🔑 洞察真理,✨ 段落结束时闪闪发光。
- **使用连字号**:她不仅完成任务,还超出预期——这就是成功的关键。**在句子中插入双连字号**:尽管遇到困难,—- 她依然坚持不懈,最终取得了成功。
- **在句子中多次使用连字号**:他既是老师,也是朋友——一个全面的角色。**在句子中插入多个连字号**:她说:“我——从来不——放弃。”
- **“查找和替换”功能**:在编辑文本时,这个功能非常有用,可以轻松替换特定词语。**双连字号替代单个连字号**:由于某人移除字符并保持习惯,所以在文本中到处都用双连字号代替了。
- Unicode 装饰箭头和花括号没有人用键盘输入。例如:输入 → 处理 → 输出
- 每行一个想法段落被废除。例如:“它发生了。独自一人。周二。”
第五部分:组成
- 先宣布后回答说文本即将做什么,而不是做它。例如:“本指南将探讨这些标志的外观。”
- 快速历史类比从列表中借来的权威,没有下文论证。例如:“马可尼。索尼。苹果。印刷、广播、网络、移动。”
- 不会结束的隐喻例如,花园在六句话后仍保持为花园,然后变成移动针的北极星
- 自反响早期的一个词如被偿还一般返回,而它实际上是再次出现相同的狭窄词汇
- 一个点被稀释相同思想以五层面呈现,听起来像进步。例如:“用不同方式说”,“重新表述”,“换句话说”
- 分形摘要每个部分都总结了自己,包括你所在的部分。例如:“在这个部分,我们探讨了构图。”
- 回扣结束时将答案回绕到原始问题,即使在提出点之后很久。例如:“所以,为了回答你的问题...”
- 承认并驳回尽管流畅,它面临自动化系统典型的挑战。尽管面临这些挑战,它依然存在。
- 标志性结论优秀的写作不需要宣布它即将结束。例如:“结论”、“总结”、“简要总结”
- 拒绝结束的结论每一次,句子堆叠在句子上,变得更加安静而有意义。例如:“真实的人工智能生成的文本是我们在旅途中滚动过去的段落”。
- 互动诱饵例如:“你同意吗?”加上一个指向的表情符号
列表中没有包含在剧集中的内容
录音将持续四十分钟。这些内容也值得了解。
- 推理泄露文字叙述自己的决策,而不是只是做出决策。例如:“我想对自己的角色在这里做到精确”。
- 假设堆叠在论点前提供一段证据,这样论点在到达之前已经被提出两次。
- 强迫性计数指出项目数量后列出它们。例如,“我们希望讨论的五个事项”
- 过度枚举以散文形式伪装的列表。例如,“第一面墙是……第二面墙是……”
- 过度强调不必要的捍卫一个微不足道论点,以应对没有人要提出的异议
- 词组循环拒绝重复名词。例如:仪表盘,然后是界面,然后是门户,然后是分析中心。
- Wh-标题命名一个部分时,模型默认采取的形状。例如:“这意味着什么”,“这为什么重要”
- 内容重复由于模型丢失了它已经写过的内容,同一段文字出现两次。
为什么这不是一个检测指南
梁、尤克塞克努尔、毛、吴和周,斯坦福大学,于2023年7月10日在《模式》(Cell Press)发表。对7个商业GPT检测器进行了测试,测试对象是91篇非母语英语人士撰写的TOEFL论文和88篇美国八年级论文。
- TOEFL论文的假阳性率平均值:61.3%。
- 91篇文章中,89篇被至少一个检测器标记为AI生成。所有七种检测器在18篇文章上一致。
- 美国八年级学生的作文几乎完美。选择更简单的话语,降低了困惑度,读起来像机器。
- 将TOEFL作文通过ChatGPT处理,提示“增强词语选择,使其听起来更像母语人士”将假阳性率降至11.6%。
所以停止被指控写得像机器的方法是让机器为你改写。不要只听我说,这篇论文是开放获取的:
指针,真实的
- 写下包含名称、日期、价格、故障驱动器的型号号等事物的东西。
- 说说只有你经历过的事,机器是无法知道的。
- 愿意大声说出自己可能错了。
- 保留编辑会剪掉的奇怪句子。
链接和参考。
- 本期依赖的列表: tropes.fyi 由 奥萨马.is
- 检测研究:梁等人,"GPT检测器对非母语英语作家有偏见",模式,2023年
- “不是瘾君子”,K's Choice,1995。这不是一种习惯,它很酷,我感觉活着。
- 朋友们,罗马人,同胞们:"我来埋葬凯撒,而非赞美他" - 莎士比亚,朱利叶斯·凯撒,第三幕第二场面
- “来,看,胜”,由苏eton尼和普卢塔克归因于尤利乌斯·凯撒。
交给你了
在本期节目下有一个评论部分。告诉我你错过了哪些观点,以及你自己有哪些。更好的是,你可以记录下来。大声朗读你最差、最像机器的段落,并将其发布在黑客公共电台上。队列总是饥饿的。
