粘贴任意论文、作业、文章或邮件,即可立即检测其是否由 ChatGPT、 Claude、Gemini 或其他 AI 撰写。Leap 提供逐句评分, 无需注册,不限字数,也没有月度配额。
Leap 在文本中读取哪些信号
大多数检测器只会给出一个 0–100 的总分。Leap 则为每个句子单独打分。 这样一来,您能精确看到是哪些句子触发了分类器、哪些句子已经读起来自然, 从而可以做精准修改,而不需要把整段文章推翻重写。
困惑度:每个词的可预测程度
困惑度衡量的是一个词在前文条件下有多出乎意料。大语言模型按设计就是选最可能的下一个词,因此整篇输出的困惑度会被均匀压低。当 Leap 发现一段较长的文本持续处在这种“低惊讶”状态时,就会标记该区域。
突发性:句子节奏的不规则程度
人类写作会不规律地混用长短句;模型则倾向输出长度相近、近乎等长节奏的句子。Leap 测量这种节奏波动(突发性),以识别 AI 特有的整齐度。
AI 典型用词
有一类“表层”词汇被模型用得过于频繁——“在当今数字化时代”“至关重要”“值得一提的是”“综上所述”。Leap 会评估这类短语的密度,并与统计指标综合判断,而不是单凭词表下结论。
套路化的缓和语与连接词
模型倾向于过度使用各种缓和语(“在某种程度上”“可以说”)以及整齐的排比结构。Leap 把这类情态词的密度作为统计指标之外的补充信号。
如何解读 0–100 分数
Leap 会给每句话打 0(非常像人类)到 100(几乎肯定是 AI)之间的分数, 同时给出整篇文本的总分。行内高亮颜色会突出对总分影响最大的句子。 这不是非黑即白的判决,而是文本统计信号的热力图。
| 分数 | 解读 | 通常意味着 |
|---|---|---|
| 0–30 | 读作人类写作 | 节奏不规则,词汇多样,困惑度处在中到高区间。 |
| 30–60 | 灰色地带 | 正式或过于平稳的文字——请结合标记句再做判断。 |
| 60–85 | 疑似 AI | 节奏过于齐整,套话密集。Turnitin、GPTZero、Originality 通常会命中。 |
| 85–100 | 高置信度 AI | 统计信号非常强,几乎可以确定出自大模型。 |
上述区间仅供参考。同一段文本在不同检测器之间会出现不同分数—— 这也是 Leap 选择展示逐句信号、而不是把一切压缩成一个数字的原因。
如何使用检测器
粘贴文本
复制任意片段——论文、作业、邮件、博客文章。理想情况下不少于 50 词;低于这个长度,任何工具的检测可靠性都会下降。
查看逐句评分
Leap 会为每个句子显示独立分数和颜色标记。哪句话触发了分类器一目了然,不需要反复通读全文找线索。
决定:自己改或直接人性化
如果只有两三句被标记,自己改写可能就够了。如果整段都是红色,建议直接交给人性化工具——Leap 允许重新检测,并查看处理前后的对比。
Leap 能识别哪些模型
| 模型家族 | 覆盖版本 | 内部测试 |
|---|---|---|
| OpenAI ChatGPT | GPT-3.5、GPT-4、GPT-4o、GPT-5 | 识别稳定 |
| Anthropic Claude | Sonnet、Opus、Haiku(全代) | 识别稳定 |
| Google Gemini | Pro、Ultra、Flash | 识别稳定 |
| Meta Llama | 3、3.1、3.2、4 | 识别稳定 |
| Mistral | Large、Medium、Small、Mixtral | 识别稳定 |
| Perplexity、Grok、DeepSeek | 当前所有版本 | 识别稳定 |
基于内部测试的定性汇总。准确率会随新模型发布和分类器更新而变化—— 请在自己的文本上运行一次检测,查看真实的逐句分数。
