ModelsExam:大模型 API 真伪与协议一致性检测

只做真模型,不做假货,不掺水。输入任意 Claude、OpenAI 兼容或图像模型的 API 地址,ModelsExam 发送一组固定请求,如实记录返回了什么,并附上证据。每份报告公开,只统计断言得分,不为任何服务商背书。 Independent exams for Claude, OpenAI-compatible and image model APIs.

已完成 1 次检测,覆盖 1 个站点、1 个模型。数据来自公开检测记录,实时统计。

ModelsExam 徽章代表什么

  • 只做真模型,不做假货,不掺水:检查端点的真实行为——身份问答、行为指纹和能力探测,低价模型冒充高价模型通常会在这里露出破绽。
  • 符合官方协议,不虚标:同一组请求遵循官方约定的字段、流式、工具调用和错误格式;上报的 Token 用量会与实际发送内容比对,虚增的数字会被标出。
  • 服务稳定,检测日期看得见:徽章只和最近一次检测一样新,30 天后过期;每份报告都列出延迟和失败的请求。
  • 开源,结果公开:代码采用 AGPL-3.0,所有记录公开。

检测怎么做

  • 选择你的端点使用的协议:Claude(Anthropic Messages)、OpenAI 兼容(Chat Completions 与 Responses)或图像生成(OpenAI Images)。
  • 填写 Base URL 和 API Key,来源可以选官方 Key、AWS Bedrock 或其他类型;系统会读取该站的 /v1/models,点选要检测的模型。
  • ModelsExam 发送一组固定请求,记录端点实际返回的内容并附上证据。
  • 阅读公开报告:每个结果只描述一个端点在某一时刻的表现,不是排名,也不是背书。

如何读懂徽章

观测项(如延迟、缓存)和来源验证结果会出现在报告里,但不会改变徽章。

  • 符合(100 分):所有计分检查均通过。
  • 基本符合(80 到 99 分):大部分计分检查通过,报告会列出未通过项。
  • 建议核对(低于 80 分):计分检查未通过。
  • 未完成:检测在所有检查完成前已停止,因此不给出结论。

官方基线

基线是在服务商自己的端点上直接跑的同一套检测。把中转站的报告放在旁边对照,就能看出它和源头有哪里不同。

  • Anthropic API(api.anthropic.com):Claude 一致性检测。
  • AWS Bedrock:Claude 一致性检测。
  • OpenAI API(api.openai.com):OpenAI 兼容检测。
  • OpenAI Images(api.openai.com):图像检测。

站长:在你的网站展示保真徽章

输入你的域名,复制代码:适合 new-api 首页的脚本、图片或 Markdown。徽章显示你域名下端点的最近一次检测结果,链接到公开报告,只在你自己的域名下提供,检测 30 天后过期。支持亮色、暗色和自动主题。

claude-opus-5 检测榜单

  1. Modelsell(modelsell.cc):100 分,符合,其他,检测于 2026-10-04

常见问题

ModelsExam 是什么?
ModelsExam 是开源(AGPL-3.0)的独立检测服务:向你指定的 Claude、OpenAI 兼容或图像模型 API 地址发送一组固定请求,检查模型表现是否与声称的一致、协议是否符合官方、用量是否虚标,并生成公开的检测报告。
怎么判断中转站的模型是不是真的?
单靠让模型自报家门并不可靠。ModelsExam 综合身份问答、行为指纹和能力探测,再对照官方基线,并检查字段、流式、工具调用、错误格式和 Token 用量是否符合官方协议。便宜模型冒充高价模型,通常会在这些检查里露出破绽。
检测需要填写 API Key 吗?密钥会泄露吗?
需要。密钥只在本次检测中使用,不会写入报告,也不会出现在公开记录里。建议使用专门为检测创建、额度有限的密钥,检测后可以停用。
得分 100 就代表可以放心购买吗?
不能这样理解。分数只统计计分断言,描述的是某个地址在某一时刻的一次表现,是证据而不是保证,更不是排名或背书。徽章 30 天后过期,请以检测日期为准。
榜单是怎么排序的?
每个模型的榜单取每个站点最近一次已完成且有得分的检测,按得分从高到低排序,得分相同时较新的检测排在前面;超过 30 天的结果会标为已过期。榜单是检测结果的列表,不是对站点好坏的评价。
我是站长,怎么展示检测徽章?
在“获取徽章”页输入你的域名,复制脚本、图片或 Markdown 代码即可。徽章只在你自己的域名下显示,来自你域名下端点的最近一次检测,30 天后过期,并链接到公开报告。
检测会产生费用吗?
检测会向你填写的上游发送最多二十多次请求,可能产生上游服务商的少量费用,每次请求最长等待 90 秒,整轮检测最长 10 分钟。

最近的检测记录

  • Modelsell (modelsell.cc),模型 claude-opus-5: 符合(100/100)(检测于 2026-10-04). Compare and access AI model providers, API pricing, supported endpoints and capabilities on Modelsell.

已检测的模型

最近检测的站点