Knowledge benchmark / 25
知识覆盖检测站
查看管理员固定模型的实时检测,也可使用自己的 Key 和模型自测。
管理员固定检测 · 公开结果
管理员设置固定模型实时状态
正在读取固定检测状态…
仅检测 gpt-6-astra、gpt-6.1-sol。首题答错或未知进入 25 题,低于 15 分继续鹈鹕骑车采样。
首题筛查 → 25 题 → 鹈鹕骑车严格结构约束 · 服务端复核
访客自测 · 分阶段检测
- 第一阶段 · 当前日本首相答对结束本次;答错或不知道继续。
- 第二阶段 · 25 道知识题固定答案评分,分别记录答错和未知。
- 第三阶段 · 鹈鹕骑车采样第二轮完成且低于 15 分才触发。按 gpttesticu 的前 3 段 / 2000 字关键词规则判断;15 分不触发。
首相答案核验于 2026-10-06;超过有效日期将暂停检测,避免用过期答案误判。
请求使用 Chat Completions 的 Structured Outputs:json_schema + strict:true。前两轮接口不支持时直接报错,不自动降级;第三轮使用 Responses 流式文本采样。
粘贴 JSON 评分
适合离线模型或重放测试。必须是单个 JSON 对象;代码块、额外字段、漏题和错误数组都会判为格式错误。
最近记录
保留本会话的原始回答与逐题结果,最多显示最近 100 条。访客记录互相隔离,管理员记录仅管理员可见。只有 Key、题库、接口、模型、阶段和参数完全一致的在线记录才会比较基线;手动导入单独比较。
加载中…
给开发者的接入说明
API 请求里的 JSON Schema 只约束字段和数组形状,不包含正确答案和 enum。正确答案只在服务端 data/answer-key.json 评分。生产环境请将站点放在 HTTPS 下,把 config.local.php 和 storage/ 放在不可公开下载的位置,并优先使用服务端环境变量 MODEL_API_KEY。