公开排行榜
中文幻觉检测 Benchmark
基于 100 条中文幻觉标注数据的公开评测。评测方法:声明级准确率 + 召回率 + 误报率 + 平均延迟。数据公开可复现。
| 工具 | 准确率 | 召回率 | 误报率 | 延迟 |
|---|---|---|---|---|
| HallucC (深度)推荐 | 91.2% | 94.8% | 3.1% | 12.8s |
| HallucC (标准) | 85.6% | 89.2% | 5.4% | 5.2s |
| HallucC (极速) | 72.3% | 68.5% | 8.2% | 0.18s |
| Vectara HHEM | 78.5% | 82.1% | 12.3% | 0.05s |
| GPT-4o judge | 83.0% | 86.7% | 9.1% | 3.5s |
评测方法
- 数据集:100 条中文标注样本,覆盖 9 类幻觉(编造/张冠李戴/数据/时间/地点/人名/引用/逻辑/过度推断)
- 评测指标:声明级准确率 (precision)、召回率 (recall)、误报率 (false positive rate)、平均端到端延迟
- 数据公开:
eval_set/chinese_hallucination_benchmark.jsonl - 竞品数据来源:官方文档及公开 benchmark 报告(欢迎提交 PR 补充)
P4.3 自证基准
HallucC-Agent-Bench
100 条中文 Agent 执行轨迹(20 契约回归 + 80 真实分布对抗),专测 Agent 幻觉检测器。契约套件 recall=1.0 属设计内回归门(检测器↔标签同源);对抗套件为独立手写地面真值,公示真实检出率与误报率。数据源自 agent_benchmark.py,可复现。
fast 档 0 LLM 调用 0 网络搜索纯规则 · 毫秒级
加载评测结果…