Knowledge benchmark / 25

知识覆盖检测站

查看管理员固定模型的实时检测,也可使用自己的 Key 和模型自测。

管理员固定检测 · 公开结果

固定模型实时状态

管理员设置

正在读取固定检测状态…

仅检测 gpt-6-astra、gpt-6.1-sol。首题答错或未知进入 25 题,低于 15 分继续鹈鹕骑车采样。

首题筛查 → 25 题 → 鹈鹕骑车严格结构约束 · 服务端复核

访客自测 · 分阶段检测

  1. 第一阶段 · 当前日本首相答对结束本次;答错或不知道继续。
  2. 第二阶段 · 25 道知识题固定答案评分,分别记录答错和未知。
  3. 第三阶段 · 鹈鹕骑车采样第二轮完成且低于 15 分才触发。按 gpttesticu 的前 3 段 / 2000 字关键词规则判断;15 分不触发。

首相答案核验于 2026-10-06;超过有效日期将暂停检测,避免用过期答案误判。

请求使用 Chat Completions 的 Structured Outputs:json_schema + strict:true。前两轮接口不支持时直接报错,不自动降级;第三轮使用 Responses 流式文本采样。

从接口读取并仅保留两种允许的模型

部分模型不支持 Temperature 或推理强度,可留空。每次检测调用 1–3 次接口;实时监测会重复此流程。

每次流程结束后等待指定秒数,不重叠请求。首题答对只结束当前检测,监测仍会按间隔继续。每次调用均可能计费;关闭或刷新页面后不再开始新检测。

题库版本 knowledge-25-v1.0.0

粘贴 JSON 评分

适合离线模型或重放测试。必须是单个 JSON 对象;代码块、额外字段、漏题和错误数组都会判为格式错误。

最近记录

保留本会话的原始回答与逐题结果,最多显示最近 100 条。访客记录互相隔离,管理员记录仅管理员可见。只有 Key、题库、接口、模型、阶段和参数完全一致的在线记录才会比较基线;手动导入单独比较。

加载中…
给开发者的接入说明

API 请求里的 JSON Schema 只约束字段和数组形状,不包含正确答案和 enum。正确答案只在服务端 data/answer-key.json 评分。生产环境请将站点放在 HTTPS 下,把 config.local.php 和 storage/ 放在不可公开下载的位置,并优先使用服务端环境变量 MODEL_API_KEY。

查看输出 Schema 查看测试提示词 JSON