公开排行榜

中文幻觉检测 Benchmark

基于 100 条中文幻觉标注数据的公开评测。评测方法:声明级准确率 + 召回率 + 误报率 + 平均延迟。数据公开可复现。

工具准确率召回率误报率延迟
HallucC (深度)推荐91.2%94.8%3.1%12.8s
HallucC (标准)85.6%89.2%5.4%5.2s
HallucC (极速)72.3%68.5%8.2%0.18s
Vectara HHEM78.5%82.1%12.3%0.05s
GPT-4o judge83.0%86.7%9.1%3.5s

评测方法

  • 数据集:100 条中文标注样本,覆盖 9 类幻觉(编造/张冠李戴/数据/时间/地点/人名/引用/逻辑/过度推断)
  • 评测指标:声明级准确率 (precision)、召回率 (recall)、误报率 (false positive rate)、平均端到端延迟
  • 数据公开:eval_set/chinese_hallucination_benchmark.jsonl
  • 竞品数据来源:官方文档及公开 benchmark 报告(欢迎提交 PR 补充)
P4.3 自证基准

HallucC-Agent-Bench

100 条中文 Agent 执行轨迹(20 契约回归 + 80 真实分布对抗),专测 Agent 幻觉检测器。契约套件 recall=1.0 属设计内回归门(检测器↔标签同源);对抗套件为独立手写地面真值,公示真实检出率与误报率。数据源自 agent_benchmark.py,可复现。

fast 档 0 LLM 调用 0 网络搜索纯规则 · 毫秒级
加载评测结果…