首页

PelicanBench · 社区视觉基准

一只鹈鹕,
一辆自行车。

把同一段提示词交给模型,看它能不能用内联 SVG 把外形、踩踏和车轮转起来。测试者对照画面,人工判断接进来的到底像不像模型真身,还是被路由、降智之后的替身。

  • 密钥默认只在这台浏览器里使用,服务器不保存
  • 提示词固定,方便社区对照,而不是比谁会改题
  • 第三方渠道可以自愿公开去掉密钥后的 Base URL
一只鹈鹕骑着自行车,侧面看去车轮、车架和喙都清楚
社区公示1不含视觉基准
覆盖模型1按公示里的模型名去重
第三方渠道1官方声明 0 条
近 24 小时访问145 个地址
累计访问14只记页面,不记密钥
平均耗时4 分 29 秒从发出到收完
平均输出 Token4,957接口没返回就空着
视觉基准3人工绘制,不是模型

怎么用

三次动作,一次对照

1

接上你的接口

填写 Base URL 和密钥,选择 Chat、Responses 或 Claude。模型列表从对方的 /models 读取。

2

用标准提示词生成

思考强度会映射到 reasoning_effort 或 Claude 的 budget。页面直接渲染返回的 HTML。

3

看完再决定公示

记录 token、用时、模型和思考强度。只有你打开公示,渠道选项才会出现。

最近公示

社区交上来的画面

全部公示

视觉基准

先看一只结构清楚的鹈鹕

下面三套动画是站点绘制的对照,不是模型成绩。用来记住:喙、喉囊、两只轮子、车架和踩踏,应该能分开看见。

边界

这不是自动评分器

画得好,不能单独证明模型没被路由;画得乱,也不能单独定罪。它只是让差异变得可见。同一模型、同一档思考,多看几次,再和基准、和其他渠道放在一起。