PelicanBench · 社区视觉基准
一只鹈鹕,
一辆自行车。
把同一段提示词交给模型,看它能不能用内联 SVG 把外形、踩踏和车轮转起来。测试者对照画面,人工判断接进来的到底像不像模型真身,还是被路由、降智之后的替身。
- 密钥默认只在这台浏览器里使用,服务器不保存
- 提示词固定,方便社区对照,而不是比谁会改题
- 第三方渠道可以自愿公开去掉密钥后的 Base URL

怎么用
三次动作,一次对照
1
接上你的接口
填写 Base URL 和密钥,选择 Chat、Responses 或 Claude。模型列表从对方的 /models 读取。
2
用标准提示词生成
思考强度会映射到 reasoning_effort 或 Claude 的 budget。页面直接渲染返回的 HTML。
3
看完再决定公示
记录 token、用时、模型和思考强度。只有你打开公示,渠道选项才会出现。
最近公示
社区交上来的画面
视觉基准
先看一只结构清楚的鹈鹕
下面三套动画是站点绘制的对照,不是模型成绩。用来记住:喙、喉囊、两只轮子、车架和踩踏,应该能分开看见。
边界
这不是自动评分器
画得好,不能单独证明模型没被路由;画得乱,也不能单独定罪。它只是让差异变得可见。同一模型、同一档思考,多看几次,再和基准、和其他渠道放在一起。