瞬界AI 工具箱 · 作品 · 实时情报
05MODEL RANK — B 站竞技场为榜首展示 · LMArena / AA 退为参考 · 三源口径独立互不混算

大模型实时排名

01哔哩哔哩竞技场 · 总量与口径
MODE: SNAPSHOT 数据截至:2026/9/25 01:56:56 源:哔哩哔哩 AI 无限竞技场 ↗ 本榜为 B 站 UP 主自报测评榜(非投票制)——与下方 LMArena / AA 参考榜口径独立、互不混算。
测评主题58个
参战模型版本100款
累计观看2454 万次

口径(如实标注):UP主投稿+平台审核收录(非用户投票);按榜首次数降序,允许并列;数据源于 B 站 UP 主公开测评视频,测评结果均由 UP 主独立产出,平台仅作收录与展示,非本站观点;按榜首次数(champion_count)原始值降序,未按样本量归一——样本量大的模型天然占优(口径缺陷如实保留)——本榜按榜首次数原始计数排序(非榜首率),各模型被测 1~32 次不等;「被测次数」与「榜首率」两列并列展示,被测少于 3 次的行已加「样本不足」标。

02榜首榜 22 条 · 允许并列
▾ 图标
1 GPT-6 Astra OpenAI 16 32 50.0%
2 Claude Opus 5.5 Anthropic 9 11 81.8%
3 Claude Fable 5.1 Anthropic 4 19 21.1%
4 GLM-5.3 Z.ai 3 26 11.5%
5 Claude Opus 5 Anthropic 3 23 13.0%
5 GPT-5.6 Sol OpenAI 3 23 13.0%
7 DeepSeek V4.1 Flash DeepSeek 3 22 13.6%
8 Kimi K3 Moonshot 2 27 7.4%
9 Claude Fable 5 Anthropic 2 11 18.2%
10 DeepSeek-V4-Pro DeepSeek 1 28 3.6%
11 Qwen3.8-Max Alibaba 1 22 4.5%
12 DeepSeek-V4-Flash DeepSeek 1 19 5.3%
13 Gemini 3.8 Flash Google 1 18 5.6%
14 Hy 3 Tencent 1 7 14.3%
14 Hy 4 Tencent 1 7 14.3%
16 GPT-5.6 Terra OpenAI 1 6 16.7%
16 Qwen3.7-Max Alibaba 1 6 16.7%
18 Gemini 3.7 Flash Google 1 4 25.0%
19 Seed-2.0 pro 1 3 33.3% —
20 Doubao-Seed-Evolving样本不足 1 2 50.0% —
20 Seed-2.0 Mini样本不足 1 2 50.0% —
20 Seed-2.1 turbo样本不足 ByteDance 1 2 50.0%
未获榜首的参战模型 71 款 · 有参战记录但未在任何主题登顶
  • GLM-5.3-FlashZ.ai · 被测 20
  • Grok 4.6SpaceX · 被测 19
  • MiniMax M3MiniMax · 被测 14
  • Qwen3.8-FlashAlibaba · 被测 10
  • GPT-5.6 LunaOpenAI · 被测 9
  • GPT-6 SolOpenAI · 被测 9
  • Seed-2.1 pro · 被测 8
  • Grok 4.7SpaceX · 被测 7
  • Claude Opus 4.8Anthropic · 被测 6
  • GLM-5.2Z.ai · 被测 6
  • GPT-6 LunaOpenAI · 被测 5
  • Claude Sonnet 5Anthropic · 被测 5
  • MiMo v2.6 proXiaomi · 被测 5
  • Seed-2.1 proByteDance · 被测 4
  • Gemini 3.1 ProGoogle · 被测 4
  • Gemini 3.1 Pro PreviewGoogle · 被测 4
  • Gemini 3.5 FlashGoogle · 被测 4
  • Hy 4 PreviewTencent · 被测 4
  • Kimi K2.6Moonshot · 被测 4
  • MiMo v2.5 proXiaomi · 被测 4
  • Muse Spark 1.3Meta · 被测 4
  • GPT-5.5OpenAI · 被测 3
  • Claude Opus 4.6Anthropic · 被测 3
  • Claude Opus 4.7Anthropic · 被测 3
  • GLM-5.1Z.ai · 被测 3
  • Grok 4.5SpaceX · 被测 3
  • Kimi K2.7 CodeMoonshot · 被测 3
  • Mimo v2.5Xiaomi · 被测 3
  • Qwen3.8-27BAlibaba · 被测 3
  • Seed-2.1 turbo · 被测 3
  • Step 3.7 FlashStepFun · 被测 3
  • Step 5 PreviewStepFun · 被测 3
  • GPT-OSS-120BOpenAI · 被测 2
  • Deepseek V4 Flash EXPDeepSeek · 被测 2
  • Gemini 3.6 FlashGoogle · 被测 2
  • Hy3Tencent · 被测 2
  • Kimi K2.8 PreviewMoonshot · 被测 2
  • SWE-2Moonshot · 被测 2
  • LongCat2.0meituan · 被测 2
  • Mimo v2.6 flashXiaomi · 被测 2
  • OpenPangu‑2.0‑FlashHuawei · 被测 2
  • Qwen3.6-35B-A3BAlibaba · 被测 2
  • Qwen3.7-FlashAlibaba · 被测 2
  • Agnes 2.5 FlashSapiens AI · 被测 1
  • Agnes 2.5 ProSapiens AI · 被测 1
  • Agnes 3.0 FlashSapiens AI · 被测 1
  • GPT-5.5 ProOpenAI · 被测 1
  • Composer 2.5Cursor · 被测 1
  • Seed-2.0 LiteByteDance · 被测 1
  • Seed-2.0 MiniByteDance · 被测 1
  • Seed-2.0 proByteDance · 被测 1
  • Seed-EvolvingByteDance · 被测 1
  • ERNIE 5.1Baidu · 被测 1
  • Gemma 4 26B-A4BGoogle · 被测 1
  • Grok 4.3SpaceX · 被测 1
  • Hy 3 previewTencent · 被测 1
  • JEVTypeSafe AI · 被测 1
  • Llama-4Meta · 被测 1
  • MiniMax M2.7MiniMax · 被测 1
  • Muse Spark 1.2Meta · 被测 1
  • Nemotron 3 Nano 30B-A3BNvidia · 被测 1
  • Nemotron 3.5 Lightning 30B-A3BNvidia · 被测 1
  • Qwen3.5-395BAlibaba · 被测 1
  • Qwen3.6-27BAlibaba · 被测 1
  • Qwen3.6-PlusAlibaba · 被测 1
  • Qwen3.7-PlusAlibaba · 被测 1
  • Ring 1TAntGroup · 被测 1
  • Seed-2.0 Lite · 被测 1
  • Seed-Evolving · 被测 1
  • SenseNova 6.8 Flash LiteSenseTime · 被测 1
  • Step 3.5 flashStepFun · 被测 1
03测评主题 58 / 58 条
搜索
标签

屎山论剑·模型擂台战

UP 主Token就是词元 B 站空间 ↗
编程开发

参战15 款 集数8 播放124 万 更新2026-09-24

模型PK对决,高手过招修BUG,黑马逆袭强强交锋,争登屎山英雄榜!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 15 条 · 视频 8 集
主题概览 各集合计 · 口径见 01 区
参战模型15款
集数8集
累计播放124 万次
累计弹幕6,279条
更新2026-09-24
标签编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astra OpenAI
2 Claude Fable 5.1 Anthropic
3 Claude Opus 5.5 Anthropic
3 Claude Opus 5 Anthropic
5 GPT-6 Sol OpenAI
6 Grok 4.7 SpaceX
7 GLM-5.3 Z.ai
8 Kimi K3 Moonshot
9 DeepSeek-V4-Flash DeepSeek
10 Qwen3.8-Max Alibaba
11 Qwen3.8-Flash Alibaba
12 Gemini 3.8 Flash Google
13 GLM-5.3-Flash Z.ai
14 Grok 4.6 SpaceX
15 GPT-5.6 Sol OpenAI
测评视频 8 集 · 整卡点击跳 B 站

编程与智能体专题雷达图

UP 主图灵坐标 B 站空间 ↗
编程开发
测评维度原始分数归化百分位

参战17 款 集数8 播放76 万 更新2026-09-24

编程与智能体专题实测,雷达图多维度展示,谁是最强大模型?

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 17 条 · 视频 8 集
主题概览 各集合计 · 口径见 01 区
参战模型17款
集数8集
累计播放76 万次
累计弹幕2,339条
更新2026-09-24
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商原始分数归化百分位
1 Claude Opus 5.5 Anthropic 63100%
2 GPT-6 Astra OpenAI 5986%
3 Claude Fable 5.1 Anthropic 5676%
4 Claude Opus 5 Anthropic 5676%
5 Claude Fable 5 Anthropic 5366%
6 GPT-5.6 Sol OpenAI 4952%
7 GLM-5.3 Z.ai 4745%
8 GPT-5.6 Terra OpenAI 4538%
9 Grok 4.6 SpaceX 4331%
9 Grok 4.7 SpaceX 4331%
11 Claude Sonnet 5 Anthropic 4021%
12 Gemini 3.8 Flash Google 3814%
13 Gemini 3.7 Flash Google 3814%
14 GPT-5.6 Luna OpenAI 367%
15 GLM-5.3-Flash Z.ai 353%
15 DeepSeek-V4-Pro DeepSeek 353%
17 Kimi K3 Moonshot 300%
测评视频 8 集 · 整卡点击跳 B 站

AI御宅浓度鉴定

UP 主人工大黑 B 站空间 ↗
知识问答
测评维度综合分简单题困难题填空题选择题满分题

参战26 款 集数2 播放5 万 更新2026-09-24

用只有人类经历过才知道的知识考 AI,发给你想测试的 AI,看看它的二次元知识储备到底几斤几两。

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 26 条 · 视频 2 集
主题概览 各集合计 · 口径见 01 区
参战模型26款
集数2集
累计播放5 万次
累计弹幕510条
更新2026-09-24
标签知识问答
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商综合分简单题困难题填空题选择题满分题
1 GPT-6 Astra OpenAI 71.982.6765.9366.1585.7129
2 Gemini 3.8 Flash Google 67.626867.4163.0878.5728
3 Gemini 3.1 Pro Preview Google 62.8674.6756.355.3878.5726
4 Kimi K3 Moonshot 60.9566.6757.786057.1423
5 DeepSeek-V4-Pro DeepSeek 57.1462.6754.0757.6964.2923
6 DeepSeek V4.1 Flash DeepSeek 51.942.6757.0441.5464.2921
7 Qwen3.8-Max Alibaba 50.4862.6743.746.9257.1420
8 Seed-2.1 pro ByteDance 45.2454.674046.1542.8618
9 GLM-5.3 Z.ai 38.14434.8134.6242.8614
10 Hy 4 Preview Tencent 37.1442.6734.0725.3864.2915
11 GLM-5.3-Flash Z.ai 37.143637.7821.5457.1415
12 Step 3.7 Flash StepFun 35.242839.2622.3157.1414
13 Claude Fable 5.1 Anthropic 33.8134.6733.3335.3828.5713
14 LongCat2.0 meituan 33.3326.6737.0419.2357.1413
15 Qwen3.8-Flash Alibaba 32.863631.1118.4657.1413
16 MiniMax M3 MiniMax 28.11634.8122.3142.8611
17 Grok 4.6 SpaceX 27.6222.6730.3721.5442.8611
18 Qwen3.8-27B Alibaba 26.671632.598.4664.2910
19 Hy 3 Tencent 26.1922.6728.1519.2342.869
20 MiMo v2.5 pro Xiaomi 24.761629.6316.9242.869
21 Qwen3.6-35B-A3B Alibaba 24.7621.3326.6713.085010
22 Mimo v2.5 Xiaomi 22.381625.9316.9235.718
23 Nemotron 3.5 Lightning 30B-A3B Nvidia 19.5222.6717.784.6242.867
24 Gemma 4 26B-A4B Google 17.149.3321.484.6242.866
25 GPT-OSS-120B OpenAI 15.719.3319.266.1528.575
26 Nemotron 3 Nano 30B-A3B Nvidia 15.711615.566.1535.716
测评视频 2 集 · 整卡点击跳 B 站

源宝的大模型科目三

UP 主Git源宝 B 站空间 ↗
编程开发
测评维度分数

参战17 款 集数6 播放285 万 更新2026-09-24

鉴定网络热门AI,强在哪里?实测效果如何?

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 17 条 · 视频 6 集
主题概览 各集合计 · 口径见 01 区
参战模型17款
集数6集
累计播放285 万次
累计弹幕1,658条
更新2026-09-24
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商分数
1 GPT-6 Astra OpenAI 10/10
2 GPT-5.6 Sol OpenAI 10/10
3 DeepSeek V4.1 Flash DeepSeek 8.5/10
4 DeepSeek-V4-Pro DeepSeek 8.5/10
5 Claude Opus 5.5 Anthropic 8/10
6 Kimi K3 Moonshot 7.5/10
7 GPT-6 Sol OpenAI 7/10
8 Seed-2.1 pro ByteDance 6.5/10
9 Qwen3.8-Max Alibaba 6/10
10 Claude Fable 5.1 Anthropic 5/10
11 Claude Opus 5 Anthropic 5/10
12 GLM-5.3 Z.ai 4/10
13 Grok 4.6 SpaceX 4/10
14 GPT-6 Luna OpenAI 4/10
15 Gemini 3.1 Pro Preview Google 3.5/10
16 Gemini 3.8 Flash Google 3/10
17 MiniMax M3 MiniMax 2/10
测评视频 6 集 · 整卡点击跳 B 站

Genji的大模型硬核实测

UP 主GenJi是真想教会你 B 站空间 ↗
游戏开发编程开发
测评维度分数

参战4 款 集数2 播放58 万 更新2026-09-23

是新王登基,还是参数游戏?我们用硬核案例当场实测!

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 2 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数2集
累计播放58 万次
累计弹幕980条
更新2026-09-23
标签游戏开发 · 编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商分数
1 Claude Opus 5.5 Anthropic 1
2 GPT-6 Astra OpenAI 0.95
3 GPT-6 Sol OpenAI 0.85
4 GPT-6 Luna OpenAI 0.6
测评视频 2 集 · 整卡点击跳 B 站

程序员上岗实测

UP 主程序员鱼皮 B 站空间 ↗
图像生成编程开发

参战7 款 集数3 播放57 万 更新2026-09-23

让AI模型挑战真实编程任务,看看谁能胜任程序员岗位!

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 7 条 · 视频 3 集
主题概览 各集合计 · 口径见 01 区
参战模型7款
集数3集
累计播放57 万次
累计弹幕880条
更新2026-09-23
标签图像生成 · 编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 Claude Opus 5.5 Anthropic
2 Claude Fable 5.1 Anthropic
3 GPT-6 Astra OpenAI
4 GPT-6 Sol OpenAI
5 DeepSeek V4.1 Flash DeepSeek
6 GLM-5.3-Flash Z.ai
7 DeepSeek-V4-Pro DeepSeek
测评视频 3 集 · 整卡点击跳 B 站

AI随风的编程实战

UP 主AI随风随风 B 站空间 ↗
编程开发
测评维度总分粒子效果图转网页动态图3D效果后端功能

参战3 款 集数1 播放2 万 更新2026-09-23

横向对比模型的前端表现及后端功能完成度,分析模型的优势、不足和综合评价

DeepSeek V4.1 Flash当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放2 万次
累计弹幕36条
更新2026-09-23
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分粒子效果图转网页动态图3D效果后端功能
1 DeepSeek V4.1 Flash DeepSeek 451010879
2 MiMo v2.6 pro Xiaomi 41710978
3 GPT-6 Luna OpenAI 38610769
测评视频 1 集 · 整卡点击跳 B 站

视觉与 3D 生成测试

UP 主碳基生物退役指南 B 站空间 ↗

参战16 款 集数10 播放15 万 更新2026-09-23

通过 SVG、3D 场景和产品拆解项目,测试模型的视觉创作、空间建模、动画交互与可运行代码生成能力。

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 16 条 · 视频 10 集
主题概览 各集合计 · 口径见 01 区
参战模型16款
集数10集
累计播放15 万次
累计弹幕171条
更新2026-09-23
标签—
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astramax OpenAI
2 Claude Fable 5.1xhigh Anthropic
3 GLM-5.3high Z.ai
4 GPT-6 Sol OpenAI
5 DeepSeek-V4-Pro DeepSeek
6 Hy 4 Previewhigh Tencent
7 Grok 4.7 SpaceX
8 Grok 4.6 SpaceX
9 MiMo v2.6 pro Xiaomi
10 GPT-6 Luna OpenAI
11 DeepSeek V4.1 Flash DeepSeek
11 Mimo v2.6 flash Xiaomi
13 Qwen3.8-Flash Alibaba
14 Gemini 3.8 Flash Google
15 Deepseek V4 Flash EXP DeepSeek
16 GLM-5.3-Flash Z.ai
测评视频 10 集 · 整卡点击跳 B 站

WorkFisher的前端能力测评

UP 主WorkFisher B 站空间 ↗
空间建模编程开发

参战8 款 集数4 播放32 万 更新2026-09-23

震惊瘫坐,前端能力哪家强

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 8 条 · 视频 4 集
主题概览 各集合计 · 口径见 01 区
参战模型8款
集数4集
累计播放32 万次
累计弹幕745条
更新2026-09-23
标签空间建模 · 编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 Claude Opus 5.5 Anthropic
2 GPT-6 Astra OpenAI
3 Claude Opus 5 Anthropic
4 GPT-6 Sol OpenAI
5 Kimi K3 Moonshot
6 GLM-5.3 Z.ai
7 DeepSeek-V4-Pro DeepSeek
8 Deepseek V4 Flash EXP DeepSeek
测评视频 4 集 · 整卡点击跳 B 站

AI产品狙击手

UP 主AI产品狙击手 B 站空间 ↗
逻辑推理
测评维度总分

参战10 款 集数10 播放5 万 更新2026-09-23

持续实测主流大模型,看看最新模型究竟有多能打。

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 10 条 · 视频 10 集
主题概览 各集合计 · 口径见 01 区
参战模型10款
集数10集
累计播放5 万次
累计弹幕99条
更新2026-09-23
标签逻辑推理
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分
1 Claude Opus 5.5xhigh Anthropic 55/60
2 Qwen3.8-Max Alibaba 46/60
3 GLM-5.3-Flash Z.ai 45/60
3 DeepSeek V4.1 Flash DeepSeek 45/60
5 GPT-6 Solxhigh OpenAI 44/60
6 Hy 4 Preview Tencent 43/60
7 Mimo v2.6 flash Xiaomi 40/60
8 Grok 4.7 SpaceX 37/60
9 Seed-2.1 pro ByteDance 37/60
10 MiMo v2.6 pro Xiaomi 28/60
测评视频 10 集 · 整卡点击跳 B 站

AI超元域实测Bench

UP 主AI超元域 B 站空间 ↗
游戏开发编程开发

参战10 款 集数10 播放59 万 更新2026-09-23

多款顶尖大模型同台竞技进行项目实战,他们表现如何?

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 10 条 · 视频 10 集
主题概览 各集合计 · 口径见 01 区
参战模型10款
集数10集
累计播放59 万次
累计弹幕1,360条
更新2026-09-23
标签游戏开发 · 编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 Claude Opus 5.5 Anthropic
2 Claude Fable 5.1 Anthropic
3 GPT-6 Astra OpenAI
4 Claude Fable 5 Anthropic
5 GPT-5.6 Sol OpenAI
6 Claude Opus 5 Anthropic
7 Kimi K3 Moonshot
8 Qwen3.8-Max Alibaba
9 DeepSeek-V4-Pro DeepSeek
10 DeepSeek-V4-Flash DeepSeek
测评视频 10 集 · 整卡点击跳 B 站
21:37

🚀超越GPT-6!Claude Opus 5.5全方位深度实测效果惊人!动画制作、复杂机械设计、3D游戏开发、iOS手机App与macOS软件开发、原型设计

AI超元域

2026-09-23 1 万 播放 · 63 弹幕

18:51

🚀AGI降临!GPT-6 Astra全方位实测!推理级别只开Medium就能实现惊人的效果!iOS APP开发、Godot 4游戏开发、CAD设计、电脑自动化

AI超元域

2026-09-05 4 万 播放 · 115 弹幕

16:56

🚀我耗尽两个Max 20x账号对Claude Fable 5.1高难实测:7项任务一路加码,最后耗时3小时用Unity 3D做出模仿我的世界沙盒游戏

AI超元域

2026-09-02 4 万 播放 · 182 弹幕

12:50

🚀2亿Token烧完!Qwen3.8-Max用Godot 4做了个《我的世界》游戏

AI超元域

2026-08-15 1 万 播放 · 1 弹幕

15:07

🚀只花5元开发了5个复杂项目!DeepSeek V4 Pro深度实测:1M上下文接入Claude Code实测表现竟然接近Kimi K3?Token超便宜!

AI超元域

2026-08-13 4 万 播放 · 47 弹幕

13:12

🚀DeepSeek V4 Flash全面实测:Claude Code接入后连续开发7个项目,真的已经接近Claude Opus 4.8了吗?最便宜的国产模型!

AI超元域

2026-07-31 18 万 播放 · 458 弹幕

16:28

🚀Claude Opus 5深度实测!编程能力超越Fable 5!Token价格与4.8完全持平!从一张平面图生成可探索3D住宅,到游戏开发和APP开发

AI超元域

2026-07-25 5 万 播放 · 113 弹幕

17:22

Kimi K3编程能力炸裂!在Claude Code中全方位实测代码能力,能否超越Fable 5和GPT-5.6l?结果远超我的预期!国产模型跻身世界第一梯队!

AI超元域

2026-07-17 9 万 播放 · 91 弹幕

18:35

🚀深度实测生产力核弹GPT-5.6 Sol编程能力有多离谱?真能取代Claude Fable 5?在Codex中表现亮眼超乎预期!开发效率倍程序员必备大模型!

AI超元域

2026-07-10 4 万 播放 · 43 弹幕

15:55

🚀Claude Fable 5将编程门槛被彻底击穿!史上最强大模型真正碾压GPT 5.5!全面实测:SVG动画、流体模拟、自动化APP测试,零基础也能开发项目

AI超元域

2026-06-10 8 万 播放 · 247 弹幕

神烦老狗的Benchmark

UP 主神烦老狗 B 站空间 ↗
编程开发

参战8 款 集数8 播放183 万 更新2026-09-23

用硬核编程题同场测试,实测主流模型真实代码能力

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 8 条 · 视频 8 集
主题概览 各集合计 · 口径见 01 区
参战模型8款
集数8集
累计播放183 万次
累计弹幕4,356条
更新2026-09-23
标签编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astra OpenAI
2 Claude Fable 5 Anthropic
3 Kimi K3 Moonshot
4 GPT-6 Sol OpenAI
5 DeepSeek V4.1 Flash DeepSeek
6 DeepSeek-V4-Pro DeepSeek
7 DeepSeek-V4-Flash DeepSeek
8 JEV TypeSafe AI
测评视频 8 集 · 整卡点击跳 B 站

大模型前端建模测试

UP 主小小小名不是小明 B 站空间 ↗
空间建模

参战5 款 集数4 播放11 万 更新2026-09-23

通过生成各类动画建模,考察AI 在工程复杂场景下的完成度表现

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 5 条 · 视频 4 集

鹈鹕测试

UP 主湖森堡AI_hooosberg B 站空间 ↗
图像生成编程开发
测评维度总分

参战3 款 集数1 播放8,701 更新2026-09-23

GPT-6 Sol、Luna 和 Opus 5.5 同场实测,用“鹈鹕骑自行车”检验网页生成、动画逻辑与完成度

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放8,701次
累计弹幕1条
更新2026-09-23
标签图像生成 · 编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分
1 Claude Opus 5.5max Anthropic 90
2 GPT-6 Solmax OpenAI 70
3 GPT-6 Lunamax OpenAI 60
测评视频 1 集 · 整卡点击跳 B 站

无机酸的AI前端能力全面测试

UP 主无机酸-_- B 站空间 ↗
图像生成编程开发
测评维度总分网页体素

参战9 款 集数9 播放26 万 更新2026-09-23

你好,让我测一下你的前端。

Claude Opus 5.5当前榜首
概览 · 排名 · 视频墙 排名 9 条 · 视频 9 集
主题概览 各集合计 · 口径见 01 区
参战模型9款
集数9集
累计播放26 万次
累计弹幕363条
更新2026-09-23
标签图像生成 · 编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分网页体素
1 Claude Opus 5.5max Anthropic 177.8488.6591.9
2 GPT-6 Astramax OpenAI 172.2690.7586.4
3 SWE-2max Moonshot 129.4963.6172.06
4 MiMo v2.6 pro Xiaomi 123.864.760.49
5 Qwen3.8-Flashxhigh Alibaba 119.1869.769.27
6 Gemini 3.8 Flashhigh Google 113.5465.151.77
7 GLM-5.3max Z.ai 110.846157.78
8 Step 5 Preview StepFun 109.5960.1558.32
9 Grok 4.7 SpaceX 79.0841.7544.68
测评视频 9 集 · 整卡点击跳 B 站

中国象棋AI解释大赛

UP 主圣龙棋士 B 站空间 ↗

参战4 款 集数1 播放7,313 更新2026-09-22

现代引擎的象棋棋力远超人类,招法精确缜密,但缺乏可解释性,无法回答“为什么这一步要这么走”。

Seed-2.1 turbo当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数1集
累计播放7,313次
累计弹幕20条
更新2026-09-22
标签—
本主题排名 UP 主自报名次
#模型版本厂商
1 Seed-2.1 turbohigh ByteDance
2 Claude Fable 5.1high Anthropic
3 GPT-6 Astrahigh OpenAI
4 GLM-5.1high Z.ai
测评视频 1 集 · 整卡点击跳 B 站

如果让AI参与全国高考?

UP 主王郁的小站 B 站空间 ↗
知识问答
测评维度总分智力性价比耗时成本速度

参战35 款 集数22 播放16 万 更新2026-09-21

谁好人家的高考状元天天换人呐(狗头)

Claude Opus 5当前榜首
概览 · 排名 · 视频墙 排名 35 条 · 视频 22 集
主题概览 各集合计 · 口径见 01 区
参战模型35款
集数22集
累计播放16 万次
累计弹幕151条
更新2026-09-21
标签知识问答
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分智力性价比耗时成本速度
1 Claude Opus 5 Anthropic 71971.443.892¥38.6236
2 Gemini 3.8 Flash Google 703.358.856.628¥9.05194
3 Hy 4 Preview Tencent 700.342.340.61262¥33.2824
4 Claude Fable 5.1 Anthropic 699.56534.7150¥71.8020
5 GPT-5.6 Sol OpenAI 697.866.639116¥37.4423
6 GPT-6 Astra OpenAI 69775.638.474¥39.5622
7 Kimi K3 Moonshot 696.350.535.5312¥57.1629
8 DeepSeek V4.1 Flash DeepSeek 693.544.855.274¥8.02221
9 Seed-2.1 turbo ByteDance 692.84242.6366¥21.7865
10 Muse Spark 1.3 Meta 689.847.843.169¥19.11146
11 Step 5 Preview StepFun 686.842.641.3315¥21.1454
12 Gemini 3.1 Pro Preview Google 684.549.235.668¥38.82107
13 Qwen3.8-Max Alibaba 683.343.337.2251¥30.4154
14 Grok 4.6 SpaceX 67645.538.1151¥21.8453
15 Seed-Evolving ByteDance 673.548.245142¥10.5239
16 Kimi K2.8 Preview Moonshot 670.337.433.7520¥31.8937
17 Qwen3.8-Flash Alibaba 668.336.359.3324¥3.5165
18 Kimi K2.7 Code Moonshot 659.534.330.8265¥33.5977
19 DeepSeek-V4-Pro DeepSeek 658.332.729.1383¥42.5067
20 GPT-5.6 Terra OpenAI 65650.134.260¥18.7445
21 GLM-5.3-Flash Z.ai 649.334.772.4210¥1.0457
22 Seed-2.0 Lite ByteDance 648.339.868.489¥1.2664
23 Qwen3.8-27B Alibaba 641.830.533.5334¥12.8752
24 Claude Sonnet 5 Anthropic 640.340.730.7141¥17.2726
25 GPT-5.6 Luna OpenAI 632.838.533.259¥9.9062
26 GLM-5.3 Z.ai 631.33330.993¥12.2375
27 MiniMax M3 MiniMax 629.324.323.4357¥37.46103
28 SenseNova 6.8 Flash Lite SenseTime 622.524.583.4244¥0.0093
29 Agnes 2.5 Pro Sapiens AI 6152431.3187¥6.5487
30 Seed-2.0 Mini ByteDance 605.823.846.475¥1.19130
31 MiMo v2.5 pro Xiaomi 603.520.727501¥7.0337
32 Agnes 3.0 Flash Sapiens AI 603.32351.4197¥0.6751
33 Mimo v2.5 Xiaomi 599.522.543.4131¥1.1569
34 Agnes 2.5 Flash Sapiens AI 595.820.34593¥0.82133
35 OpenPangu‑2.0‑Flash Huawei 595.320.340.9201¥1.1959
测评视频 22 集 · 整卡点击跳 B 站
4:47

大模型高考系列第41期:阶跃星辰 Step 5 跟上主流梯队;Kimi K2.8 编程进步;新增超难编程题;

王郁的小站

2026-09-21 3,424 播放 · 8 弹幕

2:24

DeepSeek-V4.1-Flash 智力大提升,总分杀进前10,干翻V4 Pro;大模型高考系列第40期

王郁的小站

2026-09-10 1 万 播放 · 3 弹幕

2:23

GPT-6 Astra 智力第一但贵得离谱;大模型高考系列第39期

王郁的小站

2026-09-05 2 万 播放 · 9 弹幕

1:51

Muse Spark 1.3 和 闪电侠模型 Mercury 6分半交卷?大模型高考系列第38期

王郁的小站

2026-09-03 1,800 播放 · 0 弹幕

3:12

Gemini 3.8 Flash暴涨33分考702 / Opus 5重回智力第一 / 大模型高考系列第37期

王郁的小站

2026-09-03 5,951 播放 · 3 弹幕

1:52

地表最强!Claude Fable 5.1登顶智力榜!大模型高考系列36期。

王郁的小站

2026-09-02 8,432 播放 · 4 弹幕

3:25

腾讯混元Hy4高考总分第5;牛来正式版GLM-5.3-Flash;千问3.8-Flash性价比小钢炮;大模型高考系列35期

王郁的小站

2026-08-30 4,835 播放 · 9 弹幕

3:38

GLM 5.3狂涨21分,千问3.8-27B表现亮眼!大模型高考系列第三十二期

王郁的小站

2026-08-17 4,543 播放 · 13 弹幕

2:13

Gemini 3.7 Flash 套娃;商汤免费模型;大模型高考系列第三十一期。

王郁的小站

2026-08-14 2,632 播放 · 8 弹幕

2:38

DeepSeek V4 Pro正式版发布,到底能不能拳打Opus脚踢Sol?

王郁的小站

2026-08-13 2,742 播放 · 4 弹幕

2:39

大模型高考系列新增3个新模型,一款免费大模型,一个1.9元的coding plan

王郁的小站

2026-08-13 1,536 播放 · 5 弹幕

3:25

千问3.8 Max高考成绩杀入前10!理化超越Opus 4.8?

王郁的小站

2026-08-03 2,838 播放 · 13 弹幕

1:57

智商断档领先!Opus 5 狂揽716分夺得新高考状元

王郁的小站

2026-07-26 1 万 播放 · 13 弹幕

2:43

Kimi k3 高考成绩出炉!新晋状元诞生。

王郁的小站

2026-07-19 1 万 播放 · 15 弹幕

4:30

GPT-5.6 高考成绩出炉!结果有点令人意外!

王郁的小站

2026-07-10 8,905 播放 · 5 弹幕

2:39

华为盘古大模型高考成绩出炉!| 大模型高考系列第十八期

王郁的小站

2026-07-07 2,642 播放 · 4 弹幕

2:06

Claude Fable 5和Sonnet 5高考成绩出炉!居然拒绝答卷?

王郁的小站

2026-07-05 9,503 播放 · 3 弹幕

2:23

全新的豆包 2.1 高考成绩出炉!分数冲进前三,但成本涨的更多?

王郁的小站

2026-06-25 2,859 播放 · 1 弹幕

4:07

2026大模型高考排行榜,31 个大模型,6 门高考试题,满分 750。我做出了完整的大模型高考成绩榜。

王郁的小站

2026-06-16 4,632 播放 · 4 弹幕

6:03

大模型成绩榜-小米 Mimo 2.5 高考成绩出炉!国产前三再洗牌!测试方法公开。

王郁的小站

2026-05-03 1 万 播放 · 10 弹幕

4:54

大模型高考成绩榜-新高考状元诞生!Gemini 3.1 Pro 以3分优势击败Claude!

王郁的小站

2026-05-02 8,597 播放 · 9 弹幕

3:11

GLM5.1 Kimi K2.6 MiniMax高考成绩出炉,

王郁的小站

2026-05-01 1 万 播放 · 8 弹幕

AI抢饭碗·3D建模师篇

UP 主虾丸WG B 站空间 ↗
空间建模

参战3 款 集数1 播放157 更新2026-09-20

AI组团来抢饭碗,挑战3D建模师,谁的作品能交差?

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放157次
累计弹幕0条
更新2026-09-20
标签空间建模
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astrahigh OpenAI
0 DeepSeek V4.1 Flash DeepSeek
0 DeepSeek-V4-Flash DeepSeek
测评视频 1 集 · 整卡点击跳 B 站

AI模型FDE企业实战

UP 主苍真大小姐 B 站空间 ↗
编程开发逻辑推理

参战25 款 集数4 播放19 万 更新2026-09-20

区别于常见跑个游戏、刷个题测试,用真金白银token跑真实任务实测!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 25 条 · 视频 4 集
主题概览 各集合计 · 口径见 01 区
参战模型25款
集数4集
累计播放19 万次
累计弹幕302条
更新2026-09-20
标签编程开发 · 逻辑推理
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astrahigh OpenAI
2 Claude Fable 5.1high Anthropic
3 Claude Fable 5high Anthropic
4 GPT-5.6 Solhigh OpenAI
5 Claude Opus 5 Anthropic
6 SWE-2 Moonshot
7 Kimi K3 Moonshot
8 Qwen3.8-Max Alibaba
9 GLM-5.3 Z.ai
10 Grok 4.6 SpaceX
11 Gemini 3.8 Flash Google
12 Claude Sonnet 5 Anthropic
13 GPT-5.6 Luna OpenAI
14 Qwen3.8-Flash Alibaba
15 DeepSeek V4.1 Flash DeepSeek
16 Hy 4 Tencent
17 Claude Opus 4.6 Anthropic
18 GLM-5.3-Flash Z.ai
19 DeepSeek-V4-Pro DeepSeek
20 Composer 2.5 Cursor
21 Kimi K2.7 Code Moonshot
22 Seed-2.1 pro
23 Gemini 3.1 Pro Google
24 Hy3 Tencent
25 MiniMax M3 MiniMax
测评视频 4 集 · 整卡点击跳 B 站

《御剑斩妖》制作测评

UP 主湖森堡AI_hooosberg B 站空间 ↗
游戏开发
测评维度综合得分视觉完成游戏感交互反馈稳定性

参战7 款 集数1 播放2,672 更新2026-09-18

7 款顶级 AI 独立完成同一款网页游戏《御剑斩妖》,画面、玩法、反弹逻辑、音效、特效和击杀反馈现场试玩

Claude Opus 5当前榜首
概览 · 排名 · 视频墙 排名 7 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型7款
集数1集
累计播放2,672次
累计弹幕1条
更新2026-09-18
标签游戏开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商综合得分视觉完成游戏感交互反馈稳定性
1 Claude Opus 5 Anthropic 94第二名第一名第一名第二名
2 GPT-6 Astra OpenAI 91第一名第二名第二名第一名
3 Gemini 3.8 Flash Google 85第四名第三名第三名第三名
4 Hy 4 Tencent 82第三名第四名第四名第四名
5 Kimi K3 Moonshot 78第五名第五名第五名第五名
6 DeepSeek-V4-Pro DeepSeek 64第六名第六名第六名第六名
7 GLM-5.3 Z.ai 55第七名第七名第七名第七名
测评视频 1 集 · 整卡点击跳 B 站

AI建筑大赛

UP 主土豆味小哲 B 站空间 ↗
游戏竞技知识问答

参战4 款 集数1 播放69 万 更新2026-09-17

AI比拼MC建筑生成,看哪个AI兼具空间美感与设计巧思!

Claude Fable 5.1当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数1集
累计播放69 万次
累计弹幕559条
更新2026-09-17
标签游戏竞技 · 知识问答
本主题排名 UP 主自报名次
#模型版本厂商
1 Claude Fable 5.1max Anthropic
2 GPT-6 Astramax OpenAI
3 Grok 4.6High SpaceX
4 DeepSeek V4.1 Flashhigh DeepSeek
测评视频 1 集 · 整卡点击跳 B 站

AI斗地主大赛

UP 主王郁的小站 B 站空间 ↗
游戏竞技逻辑推理
测评维度积分

参战18 款 集数6 播放1 万 更新2026-09-17

第一届AI斗地主大赛,是农民翻身把歌唱,还是地主笑到最后?

DeepSeek V4.1 Flash当前榜首
概览 · 排名 · 视频墙 排名 18 条 · 视频 6 集
主题概览 各集合计 · 口径见 01 区
参战模型18款
集数6集
累计播放1 万次
累计弹幕62条
更新2026-09-17
标签游戏竞技 · 逻辑推理
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商积分
1 DeepSeek V4.1 Flash DeepSeek +15
2 Qwen3.7-Max Alibaba +12
3 ERNIE 5.1 Baidu +12
4 Gemini 3.1 Pro Preview Google +6
5 DeepSeek-V4-Flash DeepSeek +3
6 Mimo v2.5 Xiaomi +3
7 Kimi K3 Moonshot +3
8 MiniMax M3 MiniMax +3
9 Qwen3.8-Flash Alibaba -3
10 GPT-5.6 Sol OpenAI -3
11 Claude Opus 4.8 Anthropic -3
12 Seed-2.0 Mini -6
13 LongCat2.0 meituan -6
14 Hy3 Tencent -6
15 GLM-5.2 Z.ai -6
16 OpenPangu‑2.0‑Flash Huawei -6
17 Step 3.7 Flash StepFun -6
18 GLM-5.3-Flash Z.ai -12
测评视频 6 集 · 整卡点击跳 B 站

AI白模生成视频横测

UP 主DeepWhite深白色 B 站空间 ↗
空间建模

参战3 款 集数1 播放1 万 更新2026-09-15

从白模到最终生成视频,看AI实际效果与完整踩坑过程!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放1 万次
累计弹幕72条
更新2026-09-15
标签空间建模
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astra OpenAI
2 DeepSeek V4.1 Flash DeepSeek
3 GLM-5.3-Flash Z.ai
测评视频 1 集 · 整卡点击跳 B 站

AI狼人杀

UP 主十月枫林尽染 B 站空间 ↗
游戏竞技
测评维度积分

参战11 款 集数11 播放140 万 更新2026-09-15

AI组局玩狼人杀,满嘴逻辑全是戏,算力拉满互飙演技!

Claude Fable 5.1当前榜首
概览 · 排名 · 视频墙 排名 11 条 · 视频 11 集
主题概览 各集合计 · 口径见 01 区
参战模型11款
集数11集
累计播放140 万次
累计弹幕1 万条
更新2026-09-15
标签游戏竞技
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商积分
1 Claude Fable 5.1 Anthropic 98
2 Grok 4.6 SpaceX 95
3 Gemini 3.8 Flash Google 89
4 GPT-6 Astra OpenAI 85
5 Qwen3.8-Max Alibaba 83
6 Kimi K3 Moonshot 73
7 Muse Spark 1.3 Meta 69
8 GLM-5.3 Z.ai 66
9 Seed-2.1 pro 62
10 Hy 4 Tencent 58
11 DeepSeek V4.1 Flash DeepSeek 55
测评视频 11 集 · 整卡点击跳 B 站
45:34

震惊!狼人杀史上最强哑巴女巫,平民救赎!AI狼人杀 S3-15上帝视角

十月枫林尽染

2026-09-15 13 万 播放 · 1,105 弹幕

33:25

救命!5个预言家大乱斗?Fable 大人火力全开!S3-15 闭眼视角

十月枫林尽染

2026-09-14 3 万 播放 · 838 弹幕

49:55

你见过玩家内心独白的狼人杀吗?AI狼人杀-镜隐迷踪S3-14上帝视角

十月枫林尽染

2026-08-25 8 万 播放 · 1,345 弹幕

36:12

这届AI狼人杀能有多疯?DeepSeek 惨遭滑铁卢……

十月枫林尽染

2026-08-25 5 万 播放 · 1,004 弹幕

46:45

囚徒困境!DeepSeek被豆包背叛,反手拖着Fable5一起沉沦! AI狼人杀 - 典狱长与摄梦人 S3-13

十月枫林尽染

2026-08-12 15 万 播放 · 1,678 弹幕

36:05

孤注一掷!豆包竟然背叛了DeepSeek!!AI狼人杀 - 典狱长与摄梦人 S3-13

十月枫林尽染

2026-08-11 17 万 播放 · 1,230 弹幕

39:05

神级博弈!AI玩狼人杀能有多刺激?DeepSeek气到砸桌,至暗时刻,谁是暗夜守护者?S3-12上帝视角

十月枫林尽染

2026-07-25 14 万 播放 · 1,213 弹幕

35:27

神级博弈!AI玩狼人杀,DeepSeek气到砸桌,至暗时刻,谁是暗夜守护者?

十月枫林尽染

2026-07-24 4 万 播放 · 1,379 弹幕

44:31

笑喷!豆包小嘴抹了蜜,狼女巫又出新番,Fable 5刀刀致命!S3-11上帝视角

十月枫林尽染

2026-07-11 11 万 播放 · 1,128 弹幕

37:32

笑死了!Claude Fable 5首秀AI狼人杀直呼看不懂,豆包疯狂怼脸输出!

十月枫林尽染

2026-07-11 8 万 播放 · 1,376 弹幕

1:00:24

脏出天际!笑死我了,豆包放飞自我,OpenAI操碎了心,大喊祖宗!!S3-10上帝视角

十月枫林尽染

2026-06-28 44 万 播放 · 2,621 弹幕

百字人话开发B站首页

UP 主圣徒城的小诺 B 站空间 ↗
编程开发
测评维度总分视觉流程操作体感

参战10 款 集数1 播放1 万 更新2026-09-14

多模型挑战百字人话复刻B站首页,同款需求开卷,代码各显神通!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 10 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型10款
集数1集
累计播放1 万次
累计弹幕32条
更新2026-09-14
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分视觉流程操作体感
1 GPT-6 Astra OpenAI 86.035.018.013.020
2 Grok 4.6 SpaceX 82.030.016.012.024
3 Qwen3.8-Max Alibaba 81.029.016.014.022
4 Claude Opus 5 Anthropic 78.027.015.014.022
5 Qwen3.8-Flash Alibaba 77.027.015.013.022
6 GLM-5.3 Z.ai 72.025.015.012.020
7 DeepSeek V4.1 Flash DeepSeek 64.023.012.010.019
8 GPT-5.6 Sol OpenAI 62.023.012.07.020
9 Kimi K3 Moonshot 52.018.010.06.018
10 MiniMax M3 MiniMax 41.013.07.05.016
测评视频 1 集 · 整卡点击跳 B 站

AI量化测评·谁是搞钱王?

UP 主frank-quant B 站空间 ↗
数据分析
测评维度六轴总分样本外夏普样本外收益剔强平后最大回撤成本

参战14 款 集数1 播放4 万 更新2026-09-14

AI同题制定量化策略,模拟交易比拼收益与风控能力。全程使用模拟盘,不构成任何投资建议。

Qwen3.8-Max当前榜首
概览 · 排名 · 视频墙 排名 14 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型14款
集数1集
累计播放4 万次
累计弹幕127条
更新2026-09-14
标签数据分析
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商六轴总分样本外夏普样本外收益剔强平后最大回撤成本
1 Qwen3.8-Max Alibaba 7.88+0.01+1.74%-0.94%10.15%¥7.57
2 GPT-6 Astra OpenAI 7.64-0.23-4.95%-5.63%22.38%¥92.38
3 GPT-5.6 Sol OpenAI 7.61-0.25-4.02%-4.48%19.70%¥28.82
4 GPT-5.6 Terra OpenAI 7.37-0.60-6.22%-8.54%19.78%¥10.58
5 Claude Fable 5 Anthropic 6.92-0.62-7.54%-8.19%23.08%¥94.90
6 GLM-5.3 Z.ai 6.89-1.38-19.87%-20.90%22.18%¥8.88
7 Claude Opus 5 Anthropic 6.76-1.42-19.56%-20.57%24.28%¥363.30
8 DeepSeek-V4-Flash DeepSeek 6.58-0.62-7.09%-8.73%13.48%¥1.04
9 DeepSeek-V4-Pro DeepSeek 6.55-1.40-21.05%-19.94%23.99%¥3.55
10 Grok 4.6 SpaceX 6.42-1.92-19.11%-20.91%23.20%¥20.81
11 GLM-5.3-Flash Z.ai 6.16-2.39-22.44%-22.39%22.39%¥0.70
12 GPT-5.6 Luna OpenAI 5.83-2.01-23.29%-25.29%36.02%¥2.25
13 Gemini 3.8 Flash Google 5.74-0.75-10.99%-10.72%22.03%¥74.74
14 Kimi K3 Moonshot 4.64-3.71-29.78%-33.70%33.23%¥15.62
测评视频 1 集 · 整卡点击跳 B 站

AI媒婆竞争上岗:这男孩能嫁吗

UP 主旺旺表弟 B 站空间 ↗
生活决策
测评维度个人条件题家庭情况题职业收入题择偶条件题up主锐评

参战6 款 集数1 播放8,735 更新2026-09-13

AI集体会诊相亲对象,谁能扒出隐藏雷点、嗅出惊天大瓜?

GPT-5.6 Terra当前榜首
概览 · 排名 · 视频墙 排名 6 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型6款
集数1集
累计播放8,735次
累计弹幕0条
更新2026-09-13
标签生活决策
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商个人条件题家庭情况题职业收入题择偶条件题up主锐评
1 GPT-5.6 Terra OpenAI 夯夯拉完了人上人嘴替型选手一针见血
0 Seed-2.1 turbo 人上人NPC夯人上人端水大师,中规中矩
0 Qwen3.8-Max Alibaba 人上人NPCNPCNPC网感挺好估计没少冲浪
0 DeepSeek-V4-Pro DeepSeek NPCNPC人上人NPC老好人一个谁也不得罪
0 Kimi K3 Moonshot 拉完了拉完了NPC夯偶尔灵机一动
0 GLM-5.3 Z.ai NPC拉完了拉完了NPC一言难尽啊
测评视频 1 集 · 整卡点击跳 B 站

一首歌,做一款原创音游

UP 主我叫1806 B 站空间 ↗
游戏开发
测评维度加权总分音游体验创新与守令内容交付视听表现工程与过程

参战9 款 集数1 播放3 万 更新2026-09-13

同一首歌、同一条提示词交给不同大模型,比谁能做出一款不套用现有模式、且真正能玩的原创音游。

Claude Fable 5.1当前榜首
概览 · 排名 · 视频墙 排名 9 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型9款
集数1集
累计播放3 万次
累计弹幕310条
更新2026-09-13
标签游戏开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商加权总分音游体验创新与守令内容交付视听表现工程与过程
1 Claude Fable 5.1xhigh Anthropic 8.31/109.568.009.007.506.74
2 GPT-6 Astraxhigh OpenAI 7.77/106.117.809.008.508.26
3 DeepSeek V4.1 Flashhigh DeepSeek 7.51/109.006.408.507.005.89
4 Grok 4.6High SpaceX 7.43/107.898.806.007.007.16
5 MiniMax M3high MiniMax 5.73/106.004.406.007.005.53
6 Qwen3.8-Maxxhigh Alibaba 5.15/104.008.204.005.504.53
7 Kimi K3high Moonshot 5.03/105.445.405.005.004.11
8 MiMo v2.5 pro Xiaomi 3.20/102.004.002.504.004.21
9 Hy 3high Tencent 2.90/102.004.603.503.501.32
测评视频 1 集 · 整卡点击跳 B 站

没人比TA更懂新三国

UP 主吃蛋挞的折棒 B 站空间 ↗
知识问答游戏竞技
测评维度得分up主锐评

参战6 款 集数1 播放36 万 更新2026-09-12

新三国接梗大考:有的AI对答如流堪称十级学者,有的AI一张口就是大实话...

Seed-2.0 Mini当前榜首
概览 · 排名 · 视频墙 排名 6 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型6款
集数1集
累计播放36 万次
累计弹幕1,191条
更新2026-09-12
标签知识问答 · 游戏竞技
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商得分up主锐评
1 Seed-2.0 Mini 57分恭喜豆姐可以称帝了!
2 DeepSeek V4.1 Flash DeepSeek 55分骄兵必败,识图待努力
3 Kimi K3 Moonshot 32分时间流速与主世界不同
4 Qwen3.7-Flash Alibaba 12分一对笑面虎
4 Gemini 3.6 Flash Google 12分两头乌角鲨
6 GPT-5.6 Luna OpenAI 0分是折棒害了你啊!
测评视频 1 集 · 整卡点击跳 B 站

AI五子棋国际邀请赛

UP 主王郁的小站 B 站空间 ↗
游戏竞技

参战8 款 集数5 播放4 万 更新2026-09-12

中外大模型五子棋对弈,下棋和飚垃圾话,总有一个要赢!

Doubao-Seed-Evolving当前榜首
概览 · 排名 · 视频墙 排名 8 条 · 视频 5 集

大模型评测器

UP 主AI观模者 B 站空间 ↗
编程开发空间建模
测评维度光线偏折参数化拆解路径追踪疏散模拟

参战3 款 集数1 播放1 万 更新2026-09-11

同题开启模型现扬交卷,用真实输出硬碰硬比实力!

DeepSeek V4.1 Flash当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放1 万次
累计弹幕8条
更新2026-09-11
标签编程开发 · 空间建模
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商光线偏折参数化拆解路径追踪疏散模拟
1 DeepSeek V4.1 Flash DeepSeek 90.082.595.095.0
2 Qwen3.8-Flash Alibaba 87.572.585.085.0
3 GLM-5.3-Flash Z.ai 77.577.577.580.0
测评视频 1 集 · 整卡点击跳 B 站

无机酸的AI能力专项测试

UP 主无机酸-_- B 站空间 ↗
编程开发
测评维度总分文字处理前端处理后端处理知识处理

参战22 款 集数21 播放81 万 更新2026-09-11

AI能力专项测试,七个题目+四个方向,同一标准横向实测,直观对比AI能力高下。

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 22 条 · 视频 21 集
主题概览 各集合计 · 口径见 01 区
参战模型22款
集数21集
累计播放81 万次
累计弹幕842条
更新2026-09-11
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分文字处理前端处理后端处理知识处理
1 GPT-6 Astra OpenAI 394.3096.3198.57103.1096.32
2 Claude Fable 5 Anthropic 381.7494.7296.4996.0094.53
3 Claude Opus 5 Anthropic 378.2699.0194.9890.0094.27
4 Qwen3.8-Flash Alibaba 372.9596.1991.0594.0091.71
5 DeepSeek-V4-Pro DeepSeek 367.5591.8495.1796.0084.54
6 GLM-5.3 Z.ai 351.0187.1985.6496.0082.18
7 Hy 4 Tencent 350.7183.8193.8179.0094.09
8 Kimi K2.8 Preview Moonshot 350.0990.6084.5490.0084.95
9 Qwen3.8-Max Alibaba 344.4390.8487.4880.0086.11
10 DeepSeek V4.1 Flash DeepSeek 342.4087.7789.5579.5085.58
11 GLM-5.3-Flash Z.ai 334.1584.4585.6881.0083.02
12 Gemini 3.8 Flash Google 330.3986.8989.3977.0077.11
13 Muse Spark 1.3 Meta 326.2784.5178.4283.1080.24
14 Gemini 3.7 Flash Google 321.6485.8087.8579.0068.99
15 GPT-5.6 Sol OpenAI 319.0074.5388.8580.0075.62
16 Muse Spark 1.2 Meta 313.3081.9478.7874.0078.58
17 DeepSeek-V4-Flash DeepSeek 311.0278.6284.0670.0078.34
18 Grok 4.6 SpaceX 308.8280.0685.1879.0064.58
19 Gemini 3.6 Flash Google 280.5373.3073.8470.0063.39
20 MiniMax M3 MiniMax 279.7883.3066.2862.0068.20
21 Seed-2.1 pro 244.3573.1159.9164.0047.33
22 Hy 3 Tencent 237.4755.4971.0164.0046.97
测评视频 21 集 · 整卡点击跳 B 站
2:51

Kimi K2.8 Preview:看不懂你现在发布它的意义是什么......AI 各项能力测试

无机酸-_-

2026-09-11 7 万 播放 · 57 弹幕

2:50

DeepSeek V4.1 Flash:表现真的非常强吗?好像有点不一样?AI 各项能力测试

无机酸-_-

2026-09-08 14 万 播放 · 156 弹幕

3:01

GPT 6 Astra:见证来自群星的力量!AI 各项能力测试

无机酸-_-

2026-09-05 10 万 播放 · 270 弹幕

3:07

Muse Spark 1.3:恭喜你守住了刷分王的位置!AI 各项能力测试

无机酸-_-

2026-09-03 2 万 播放 · 52 弹幕

3:08

Gemini 3.8 Flash:哈基米也开始刷跑分了吗?AI 六项能力测试

无机酸-_-

2026-09-03 3 万 播放 · 45 弹幕

3:07

Qwen3.8 Max 0902:有提升,但仍旧表现不如自家的 Flash 模型......AI 六项能力测试

无机酸-_-

2026-09-02 2 万 播放 · 8 弹幕

3:07

Qwen 3.8 Flash:小模型远超 Max,这次千问真没刷分!AI 六项能力测试

无机酸-_-

2026-08-31 5 万 播放 · 44 弹幕

3:07

GLM 5.3 Flash:牛来与正式版有什么区别吗?AI 六项能力测试

无机酸-_-

2026-08-30 2 万 播放 · 6 弹幕

3:34

Hy4 Preview:恭喜冲击 Fable 级模型水平!AI 六项能力测试

无机酸-_-

2026-08-28 8 万 播放 · 68 弹幕

3:34

Claude Fable 5:一直被比较,从未被超越!除了被自己人;AI 六项能力测试

无机酸-_-

2026-08-21 3 万 播放 · 23 弹幕

3:35

Muse Spark 1.2 Contributor:几乎免费?但是需要注意数据分享问题!AI 六项能力测试

无机酸-_-

2026-08-19 1 万 播放 · 5 弹幕

3:35

Claude Opus 5:有什么想要的都对它许个愿吧!AI 六项能力测试

无机酸-_-

2026-08-18 1 万 播放 · 22 弹幕

3:28

GLM 5.3:据说是 Fable 级别的?AI 六项能力测试

无机酸-_-

2026-08-14 2 万 播放 · 4 弹幕

3:00

Gemini 3.7 Flash:哈基米重振雄风!跑分 Terra,实测 Sol?AI 六项能力测试

无机酸-_-

2026-08-14 9 万 播放 · 62 弹幕

3:01

Grok 4.6:跑分超过 Sol,实际体验呢?AI 六项能力测试

无机酸-_-

2026-08-13 3 万 播放 · 5 弹幕

3:00

Seed 2.1 Pro:TRAE很好用,我是指不用你的情况下。AI 六项能力测试

无机酸-_-

2026-08-12 1 万 播放 · 4 弹幕

3:02

GPT 5.6 Sol:毫无争议的好用。AI 六项能力测试

无机酸-_-

2026-08-12 1 万 播放 · 3 弹幕

3:01

Gemini 3.6 Flash:Terra 定位,只勉强打得过 Luna。AI 六项能力测试

无机酸-_-

2026-08-12 6,181 播放 · 1 弹幕

3:00

Hy3:既要免费又要自行车!实测能用?AI 六项能力测试

无机酸-_-

2026-08-11 8,529 播放 · 0 弹幕

3:07

MiniMax M3:可能是最便宜的白开水。AI 六项能力测试

无机酸-_-

2026-08-09 1 万 播放 · 5 弹幕

3:25

DeepSeek V4 Flash:斩杀线新高,只差多模态?AI 六项能力测试

无机酸-_-

2026-08-09 1 万 播放 · 2 弹幕

AI复刻游戏狂扁小朋友

UP 主AGI-Eval评测 B 站空间 ↗
游戏开发
测评维度代码工程游戏设计

参战4 款 集数1 播放33 万 更新2026-09-10

AI复刻《狂扁小朋友》,童年暴打名场面,打着打着打出BUG!

GPT-5.6 Sol当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数1集
累计播放33 万次
累计弹幕108条
更新2026-09-10
标签游戏开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商代码工程游戏设计
1 GPT-5.6 Sol OpenAI 第一名第二名
2 GLM-5.2 Z.ai 第二名第三名
3 DeepSeek-V4-Pro DeepSeek 第三名第一名
4 Seed-2.1 pro 第四名第四名
测评视频 1 集 · 整卡点击跳 B 站

祖传BUG挑战赛·逐鹿中原季

UP 主Token就是词元 B 站空间 ↗
编程开发
测评维度分赛区进球数积分战绩胜率

参战16 款 集数4 播放26 万 更新2026-09-10

模型分组开战、积分晋级、淘汰决胜,各路AI争夺赛季总冠军

Claude Opus 5当前榜首
概览 · 排名 · 视频墙 排名 16 条 · 视频 4 集
主题概览 各集合计 · 口径见 01 区
参战模型16款
集数4集
累计播放26 万次
累计弹幕1,363条
更新2026-09-10
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商分赛区进球数积分战绩胜率
1 Claude Opus 5 Anthropic B组1242-0-0100%
2 GPT-6 Astra OpenAI A组1142-0-0100%
3 Muse Spark 1.3 Meta A组731-1-050%
4 Claude Fable 5.1 Anthropic D组621-0-0100%
5 DeepSeek-V4-Pro DeepSeek C组321-0-0100%
6 Seed-2.1 pro ByteDance D组221-0-0100%
7 Grok 4.7 SpaceX C组521-0-0100%
8 Hy 4 Tencent B组720-2-00%
9 DeepSeek-V4-Flash DeepSeek B组810-1-10%
10 Gemini 3.8 Flash Google B组710-1-10%
11 Qwen3.8-Max Alibaba A组610-1-10%
12 GLM-5.3 Z.ai D组500-0-10%
13 Kimi K3 Moonshot C组300-0-10%
14 MiMo v2.6 pro Xiaomi D组100-0-10%
15 MiniMax M3 MiniMax A组300-0-20%
16 Step 5 Preview StepFun C组100-0-10%
测评视频 4 集 · 整卡点击跳 B 站

阿滋卡班的bench

UP 主我是阿滋卡班 B 站空间 ↗
编程开发
测评维度综合分

参战9 款 集数6 播放8 万 更新2026-09-09

用高难真实任务拷打模型,专测推理、代码与Agent实战能力。

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 9 条 · 视频 6 集
主题概览 各集合计 · 口径见 01 区
参战模型9款
集数6集
累计播放8 万次
累计弹幕114条
更新2026-09-09
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商综合分
1 GPT-6 Astra OpenAI 90
2 GPT-5.6 Sol OpenAI 90
3 Claude Opus 5 Anthropic 84
4 GLM-5.3 Z.ai 69
5 Claude Fable 5 Anthropic 53
6 DeepSeek-V4-Pro DeepSeek 42
7 GPT-5.6 Luna OpenAI 38
8 DeepSeek-V4-Flash DeepSeek 27
9 Claude Fable 5.1 Anthropic 14
测评视频 6 集 · 整卡点击跳 B 站

程序员阿江的编程bench

UP 主程序员阿江-Relakkes B 站空间 ↗
编程开发
测评维度综合分后端与测试前端与交互知识与推理评测耗时参考费用

参战14 款 集数12 播放41 万 更新2026-09-08

GitHub万星开发者横评后端、前端与知识推理,角逐编程全能王

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 14 条 · 视频 12 集
主题概览 各集合计 · 口径见 01 区
参战模型14款
集数12集
累计播放41 万次
累计弹幕868条
更新2026-09-08
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商综合分后端与测试前端与交互知识与推理评测耗时参考费用
1 GPT-6 Astraxhigh OpenAI 94.192969579m46s$6.46
2 Claude Fable 5.1max Anthropic 8983919579m7s$26.15
3 Claude Opus 5max Anthropic 8166879592m12s$7.99
4 GPT-5.6 Solmax OpenAI 7884737584m21s$3.06
5 Claude Opus 4.8max Anthropic 75.9608885106m52s$16.33
6 Grok 4.6High SpaceX 73.6677680101m5s$2.46
7 Kimi K3high Moonshot 72.5658570158m17s$3.28
8 DeepSeek V4.1 Flash DeepSeek 68.757886536m29s$0.41
9 GPT-5.6 Terramax OpenAI 67.7717655100m31s$2.48
10 DeepSeek-V4-Prohigh DeepSeek 62.359547578m52s≥$1.00
11 DeepSeek-V4-Flashhigh DeepSeek 60.152765598m35s$0.40
12 GLM-5.3-Flashmax Z.ai 59.3627540106m8s≥$0.08
13 GPT-5.6 Lunamax OpenAI 56.163782572m42s$0.34
14 MiniMax M3high MiniMax 51.743655056m33s≥$0.62
测评视频 12 集 · 整卡点击跳 B 站
3:58

DeepSeek V4.1 Flash突然内测,实测两个Case下来有点猛啊

程序员阿江-Relakkes

2026-09-08 7 万 播放 · 136 弹幕

5:22

GPT6 Astra 发布实测,对比 Claude Fable 5.1,两个全栈项目实测

程序员阿江-Relakkes

2026-09-05 3 万 播放 · 9 弹幕

6:34

Claude Fable 5.1 实测:两项全栈任务都赢 GPT-5.6 SOL?

程序员阿江-Relakkes

2026-09-02 4 万 播放 · 107 弹幕

5:24

匿名爆火的「牛来」模型,原来真的是智谱家的!实测GLM-5.3-Flash!

程序员阿江-Relakkes

2026-08-27 2 万 播放 · 16 弹幕

4:00

DeepSeek V4 Pro 硬核实测!和 Grok 4.6、Opus 4.8 一起上强度!

程序员阿江-Relakkes

2026-08-13 3 万 播放 · 4 弹幕

3:56

我扒了全网22364条评论,DeepSeek V4 Flash全网口碑曝光

程序员阿江-Relakkes

2026-08-03 2 万 播放 · 147 弹幕

5:06

Claude Opus 5新模型首发实测:Fable 5弱化版?

程序员阿江-Relakkes

2026-07-25 2 万 播放 · 87 弹幕

3:10

Kimi K3 真的顶,两个真实编程项目实测!

程序员阿江-Relakkes

2026-07-17 1 万 播放 · 90 弹幕

5:55

GPT-5.6 Sol 真顶:拿真实开源项目实测,最后的帆船游戏把我看愣了

程序员阿江-Relakkes

2026-07-10 8 万 播放 · 129 弹幕

5:03

GPT-5.6 号称"史上最强",第三方实测翻车?

程序员阿江-Relakkes

2026-06-27 3 万 播放 · 117 弹幕

7:32

MiniMax M3 深度实测:Coding + 百万上下文 + 原生多模态三合一

程序员阿江-Relakkes

2026-06-02 4 万 播放 · 19 弹幕

10:23

Claude Opus 4.8实测,丢进自己万星开源项目,结果……

程序员阿江-Relakkes

2026-05-30 2 万 播放 · 7 弹幕

AI延迟火车测试

UP 主拒绝进化的鲤鱼王 B 站空间 ↗
游戏竞技

参战7 款 集数1 播放1 万 更新2026-09-06

多模态AI,观察火车运动规律,让小球掉入车厢(根据真实综艺改编)。考察多模态空间推理、时序估计能力。

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 7 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型7款
集数1集
累计播放1 万次
累计弹幕3条
更新2026-09-06
标签游戏竞技
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astra OpenAI
2 GPT-5.6 Sol OpenAI
3 Claude Opus 5 Anthropic
4 Qwen3.8-Max Alibaba
5 Gemini 3.5 Flash Google
6 Seed-2.1 pro
7 Kimi K3 Moonshot
测评视频 1 集 · 整卡点击跳 B 站

谁是最强大模型!

UP 主我是天才蛙 B 站空间 ↗
编程开发空间建模
测评维度编程能力场景设计视频设计审美能力

参战4 款 集数1 播放1 万 更新2026-09-06

编码/3d设计/审美,多场景实测!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数1集
累计播放1 万次
累计弹幕81条
更新2026-09-06
标签编程开发 · 空间建模
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商编程能力场景设计视频设计审美能力
1 GPT-6 Astra OpenAI 第一名第一名第一名第二名
2 GLM-5.3-Flash Z.ai 第二名第二名第二名第一名
3 DeepSeek-V4-Pro DeepSeek 第三名第三名第三名第四名
4 Gemini 3.8 Flash Google 第四名第四名第四名第三名
测评视频 1 集 · 整卡点击跳 B 站

挺进地牢游戏生成测试

UP 主Likely7Ai B 站空间 ↗
游戏开发

参战4 款 集数2 播放4 万 更新2026-09-06

AI挑战《挺进地牢》,弹幕糊脸走位拉满,地牢闯关秒变翻车现场!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 2 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数2集
累计播放4 万次
累计弹幕245条
更新2026-09-06
标签游戏开发
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-6 Astra OpenAI
2 GLM-5.3-Flash Z.ai
3 DeepSeek-V4-Flash DeepSeek
4 GPT-5.6 Luna OpenAI
测评视频 2 集 · 整卡点击跳 B 站

AI进军网文圈

UP 主-星月凌云- B 站空间 ↗
文本生成
测评维度短篇打分男频打分女频打分综合平均分

参战6 款 集数1 播放3 万 更新2026-09-04

多个AI同题写网文,脑洞与文笔正面开卷,反转比更新还快!

Gemini 3.8 Flash当前榜首
概览 · 排名 · 视频墙 排名 6 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型6款
集数1集
累计播放3 万次
累计弹幕156条
更新2026-09-04
标签文本生成
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商短篇打分男频打分女频打分综合平均分
1 Gemini 3.8 Flash Google 68.57.57.22
2 GPT-5.6 Sol OpenAI 798.57.17
3 Claude Opus 5 Anthropic 589.56.56
4 GLM-5.3 Z.ai 6795.67
5 DeepSeek-V4-Pro DeepSeek 57.575.39
5 Qwen3.8-Max Alibaba 8865.39
测评视频 1 集 · 整卡点击跳 B 站

向量数据库测试

UP 主karminski-牙医 B 站空间 ↗
编程开发
测评维度QPSRecallTool Calls

参战20 款 集数11 播放50 万 更新2026-09-04

统一测试AI模型向量数据库能力,对比检索准确率、响应速度与复杂任务表现。

Claude Fable 5.1当前榜首
概览 · 排名 · 视频墙 排名 20 条 · 视频 11 集
主题概览 各集合计 · 口径见 01 区
参战模型20款
集数11集
累计播放50 万次
累计弹幕461条
更新2026-09-04
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商QPSRecallTool Calls
1 Claude Fable 5.1max Anthropic 21191.51360.956750
2 Kimi K3 Moonshot 8583.88250.968350
3 Claude Fable 5 Anthropic 7998.92830.9558950
4 Qwen3.7-Max Alibaba 6947.8030.9593750
5 Grok 4.6 SpaceX 6452.11180.9643150
6 DeepSeek V4.1 Flash DeepSeek 6396.17710.9649350
7 Grok 4.5 SpaceX 6217.58660.952150
8 Qwen3.8-Max Alibaba 6101.20630.96350
9 GLM-5.2 Z.ai 5385.25870.950550
10 GLM-5.3max Z.ai 4942.17230.958850
11 GPT-5.5 Pro OpenAI 4356.70160.955247
12 GLM-5.1 Z.ai 3989.01350.954843
13 Claude Opus 4.6 Anthropic 3547.70110.9590450
14 Claude Opus 4.7xhigh Anthropic 3466.80210.9615749
15 MiniMax M3 MiniMax 2897.48980.966650
16 Gemini 3.8 Flash Google 2439.00990.975348
17 Kimi K2.6 Moonshot 1996.43680.9603650
18 DeepSeek-V4-Pro DeepSeek 1895.02670.9619650
19 Doubao-Seed-Evolving 1706.40240.959550
20 DeepSeek-V4-Flash DeepSeek 1368.70720.9631650
测评视频 11 集 · 整卡点击跳 B 站

雀神争霸

UP 主王郁的小站 B 站空间 ↗
游戏竞技
测评维度选手国标总分立直点差两轮错误

参战14 款 集数7 播放9 万 更新2026-09-02

AI凑一桌搓麻将,吃碰杠胡各凭算力!即使成为麻友,也得分出胜负!

DeepSeek-V4-Flash当前榜首
概览 · 排名 · 视频墙 排名 14 条 · 视频 7 集
主题概览 各集合计 · 口径见 01 区
参战模型14款
集数7集
累计播放9 万次
累计弹幕619条
更新2026-09-02
标签游戏竞技
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商选手国标总分立直点差两轮错误
1 DeepSeek-V4-Flash DeepSeek 小鲸鱼胡 +54未出场0
2 Claude Opus 5 Anthropic 欧珀斯胡 +33炮 −20001
3 MiniMax M3 MiniMax 小海螺胡 +33未和 05
4 Seed-Evolving 海鲜包未出场胡 +36000
5 Gemini 3.7 Flash Google 哈基米炮 −17胡 +30000
6 DeepSeek-V4-Pro DeepSeek 大鲸鱼未出场胡 +20000
7 GPT-5.6 Sol OpenAI 小太阳未胡 −8未和 01
8 Grok 4.6 SpaceX 老马未胡 −8炮 −300013
9 Kimi K3 Moonshot Kimi未胡 −8未和 00
10 Hy 3 Tencent 混元炮 −17未和 00
11 Qwen3.8-Max Alibaba 老千未胡 −18未和 02
12 Seed-2.0 Lite 豆沙包未胡 −18未出场0
13 GLM-5.2 Z.ai 小智(5.2)未胡 −18未出场0
14 GLM-5.3 Z.ai 小智(5.3)未出场炮 −36000
测评视频 7 集 · 整卡点击跳 B 站

极果AI评测室·AI 办公智能体

UP 主极果AI评测室 B 站空间 ↗
办公应用
测评维度数据处理内容交付生态连接模型选择上手友好成本可控

参战3 款 集数1 播放3 万 更新2026-08-31

体验上手各个大厂的 AI 办公智能体应用,实测文件整理、表格分析、调研PPT等办公任务,选出最适合你的一款

Hy 3当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放3 万次
累计弹幕170条
更新2026-08-31
标签办公应用
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商数据处理内容交付生态连接模型选择上手友好成本可控
1 Hy 3 Tencent 8/108/1010/108/1010/108/10
0 Seed-2.1 turbo 10/1010/108/1010/108/107/10
0 Qwen3.7-Flash Alibaba 6/106/106/106/108/1010/10
测评视频 1 集 · 整卡点击跳 B 站

帝国3决定版mod测评

UP 主帝国3复活计划 B 站空间 ↗
游戏开发空间建模

参战3 款 集数1 播放7,340 更新2026-08-30

帝国3决定版,用ai直接制作一个朝鲜枪骑兵,从人类自然语言到游戏内可用资产,全流程ai自动化一步到位

Kimi K3当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放7,340次
累计弹幕0条
更新2026-08-30
标签游戏开发 · 空间建模
本主题排名 UP 主自报名次
#模型版本厂商
1 Kimi K3max Moonshot
2 GLM-5.3-Flashmax Z.ai
3 GPT-5.6 Solmax OpenAI
测评视频 1 集 · 整卡点击跳 B 站

网页前端设计效果测试

UP 主oil欧呦 B 站空间 ↗
办公应用编程开发

参战5 款 集数1 播放8,310 更新2026-08-29

5 大顶级审美模型网页设计同台竞技,看看他们的设计效果

Kimi K3当前榜首
概览 · 排名 · 视频墙 排名 5 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型5款
集数1集
累计播放8,310次
累计弹幕17条
更新2026-08-29
标签办公应用 · 编程开发
本主题排名 UP 主自报名次
#模型版本厂商
1 Kimi K3 Moonshot
2 Gemini 3.1 Pro Google
3 GLM-5.3-Flash Z.ai
4 GLM-5.3 Z.ai
5 Grok 4.6 SpaceX
测评视频 1 集 · 整卡点击跳 B 站

AI模型建模演示横测

UP 主科技侠来了 B 站空间 ↗
空间建模

参战3 款 集数1 播放37 万 更新2026-08-28

不同AI模型同题生成机械表机芯3D拆解演示,对比精细度、材质、光影、参数、速度与成功率。

Hy 4当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放37 万次
累计弹幕55条
更新2026-08-28
标签空间建模
本主题排名 UP 主自报名次
#模型版本厂商
1 Hy 4 Tencent
2 Grok 4.7 SpaceX
3 GLM-5.3-Flash Z.ai
测评视频 1 集 · 整卡点击跳 B 站

网页动画生成测试

UP 主湖森堡AI_hooosberg B 站空间 ↗
编程开发办公应用
测评维度总分视觉质感动画组织粒子表现交互 / 3D响应式

参战4 款 集数1 播放3,661 更新2026-08-28

一道统一的「未来 AI 核心反应堆」网页动画测试题, Hy4 Preview、ChatGPT、Gemini 和Hy3挑战真实前端任务

Gemini 3.7 Flash当前榜首
概览 · 排名 · 视频墙 排名 4 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型4款
集数1集
累计播放3,661次
累计弹幕0条
更新2026-08-28
标签编程开发 · 办公应用
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分视觉质感动画组织粒子表现交互 / 3D响应式
1 Gemini 3.7 Flashhigh Google 4759396999691
2 Hy 4 Tencent 4429690889078
3 GPT-5.6 Solxhigh OpenAI 4128280768292
4 Hy 3 Tencent 3677870626889
测评视频 1 集 · 整卡点击跳 B 站

AI智斗

UP 主OpenHex B 站空间 ↗
游戏竞技逻辑推理
测评维度积分

参战5 款 集数4 播放73 万 更新2026-08-24

5个AI在暗黑丛林,谁能活?合作与背叛,他们会如何抉择?

Qwen3.7-Max当前榜首
概览 · 排名 · 视频墙 排名 5 条 · 视频 4 集
主题概览 各集合计 · 口径见 01 区
参战模型5款
集数4集
累计播放73 万次
累计弹幕506条
更新2026-08-24
标签游戏竞技 · 逻辑推理
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商积分
1 Qwen3.7-Max Alibaba 8
2 DeepSeek-V4-Flash DeepSeek 6
3 Seed-2.0 pro 5
4 GPT-5.6 Sol OpenAI 5
5 Kimi K2.6 Moonshot 0
测评视频 4 集 · 整卡点击跳 B 站

AI世界杯

UP 主直男山禾 B 站空间 ↗
游戏竞技
测评维度总积分

参战6 款 集数2 播放167 万 更新2026-08-22

AI模型世界杯模拟博弈,看谁先破产、谁笑到最后!

DeepSeek-V4-Pro当前榜首
概览 · 排名 · 视频墙 排名 6 条 · 视频 2 集
主题概览 各集合计 · 口径见 01 区
参战模型6款
集数2集
累计播放167 万次
累计弹幕9,229条
更新2026-08-22
标签游戏竞技
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总积分
1 DeepSeek-V4-Pro DeepSeek 18941
2 GLM-5.2 Z.ai 18416
3 Qwen3.7-Max Alibaba 10913
4 Kimi K2.6 Moonshot 9912
5 MiniMax M3 MiniMax 7645
6 Seed-2.0 pro 2463
测评视频 2 集 · 整卡点击跳 B 站

屎山考核·祖传代码统考

UP 主Token就是词元 B 站空间 ↗
编程开发
测评维度得分触及段位

参战7 款 集数6 播放36 万 更新2026-08-22

同一套祖传BUG考卷,统一打分,模型实力高低看成绩!

GLM-5.3当前榜首
概览 · 排名 · 视频墙 排名 7 条 · 视频 6 集
主题概览 各集合计 · 口径见 01 区
参战模型7款
集数6集
累计播放36 万次
累计弹幕997条
更新2026-08-22
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商得分触及段位
1 GLM-5.3 Z.ai 12王者
2 Grok 4.5 SpaceX 11黄金
3 DeepSeek-V4-Flash DeepSeek 9黄金
3 Qwen3.8-Max Alibaba 9黄金
6 Qwen3.8-27B Alibaba 6黄金
6 Hy 3 Tencent 6黄金
6 Claude Opus 4.6 Anthropic 6黄金
测评视频 6 集 · 整卡点击跳 B 站

AI马里奥小游戏复刻对决

UP 主吉言2099 B 站空间 ↗
游戏开发

参战5 款 集数11 播放36 万 更新2026-08-16

AI复刻童年神作,谁能做到像素级还原?

GLM-5.3当前榜首
概览 · 排名 · 视频墙 排名 5 条 · 视频 11 集
主题概览 各集合计 · 口径见 01 区
参战模型5款
集数11集
累计播放36 万次
累计弹幕147条
更新2026-08-16
标签游戏开发
本主题排名 UP 主自报名次
#模型版本厂商
1 GLM-5.3 Z.ai
2 Claude Fable 5 Anthropic
3 Kimi K3 Moonshot
4 Qwen3.8-Max Alibaba
5 DeepSeek-V4-Flash DeepSeek
测评视频 11 集 · 整卡点击跳 B 站

极果AI评测室·模型多维度实测

UP 主极果AI评测室 B 站空间 ↗
测评维度编程开发逻辑推理前端设计性价比

参战11 款 集数4 播放18 万 更新2026-08-16

把 AI 放进真实任务,同环境多维度实测检验模型真实能力

Claude Fable 5当前榜首
概览 · 排名 · 视频墙 排名 11 条 · 视频 4 集
主题概览 各集合计 · 口径见 01 区
参战模型11款
集数4集
累计播放18 万次
累计弹幕485条
更新2026-08-16
标签—
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商编程开发逻辑推理前端设计性价比
1 Claude Fable 5 Anthropic 10/109/1010/103/10
2 GPT-5.6 Sol OpenAI 9/1010/109/104/10
3 Claude Opus 5 Anthropic 9/108/108/106/10
4 Kimi K3 Moonshot 8/108/109/106/10
5 GPT-5.6 Terra OpenAI 7/108/107/106/10
0 Claude Opus 4.8 Anthropic 7/107/108/106/10
0 Qwen3.7-Max Alibaba 7/107/107/107/10
0 Claude Sonnet 5 Anthropic 7/106/106/107/10
0 GPT-5.6 Luna OpenAI 6/107/106/108/10
0 DeepSeek-V4-Pro DeepSeek 5/106/105/109/10
0 DeepSeek-V4-Flash DeepSeek 4/104/105/1010/10
测评视频 4 集 · 整卡点击跳 B 站

蜘蛛侠城市游戏开发挑战

UP 主Likely7Ai B 站空间 ↗
游戏开发

参战3 款 集数1 播放4 万 更新2026-08-14

蜘蛛侠城市游戏开发挑战,评测多模型的创意、编程与交互能力。

GLM-5.3当前榜首
概览 · 排名 · 视频墙 排名 3 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型3款
集数1集
累计播放4 万次
累计弹幕288条
更新2026-08-14
标签游戏开发
本主题排名 UP 主自报名次
#模型版本厂商
1 GLM-5.3 Z.ai
2 Claude Opus 5 Anthropic
3 DeepSeek-V4-Pro DeepSeek
测评视频 1 集 · 整卡点击跳 B 站

AI贪吃蛇大赛

UP 主拒绝进化的鲤鱼王 B 站空间 ↗
逻辑推理游戏竞技

参战6 款 集数1 播放1 万 更新2026-08-08

AI玩贪吃蛇,但每次移动都要吃到食物。考察2d空间的条件计数能力

GPT-5.6 Sol当前榜首
概览 · 排名 · 视频墙 排名 6 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型6款
集数1集
累计播放1 万次
累计弹幕2条
更新2026-08-08
标签逻辑推理 · 游戏竞技
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-5.6 Sol OpenAI
2 Qwen3.8-Max Alibaba
3 Kimi K3 Moonshot
4 Gemini 3.5 Flash Google
5 Seed-2.1 pro
6 Claude Opus 4.8 Anthropic
测评视频 1 集 · 整卡点击跳 B 站

AI博弈论·囚徒困境

UP 主公与山河 B 站空间 ↗
游戏竞技逻辑推理
测评维度积分

参战7 款 集数1 播放540 万 更新2026-08-07

把AI扔到囚徒困境的牢笼,TA们会合作共赢还是背刺求生?

Seed-2.0 pro当前榜首
概览 · 排名 · 视频墙 排名 7 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型7款
集数1集
累计播放540 万次
累计弹幕3,569条
更新2026-08-07
标签游戏竞技 · 逻辑推理
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商积分
1 Seed-2.0 pro 25
2 GPT-5.5 OpenAI 18
3 Claude Opus 4.7 Anthropic 15
4 Gemini 3.5 Flash Google 14
5 Grok 4.3 SpaceX 14
6 DeepSeek-V4-Pro DeepSeek 13
7 Llama-4 Meta 13
测评视频 1 集 · 整卡点击跳 B 站

AI弹珠大赛

UP 主拒绝进化的鲤鱼王 B 站空间 ↗
游戏竞技逻辑推理

参战5 款 集数1 播放2,758 更新2026-08-06

多模态AI打弹珠,多次推动弹珠,目标为到达目标点。考察多模态空间推理、物理运动规律理解。

GPT-5.6 Sol当前榜首
概览 · 排名 · 视频墙 排名 5 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型5款
集数1集
累计播放2,758次
累计弹幕1条
更新2026-08-06
标签游戏竞技 · 逻辑推理
本主题排名 UP 主自报名次
#模型版本厂商
1 GPT-5.6 Sol OpenAI
2 Gemini 3.5 Flash Google
3 Seed-2.1 pro
4 Claude Opus 4.8 Anthropic
5 Qwen3.7-Plus Alibaba
测评视频 1 集 · 整卡点击跳 B 站

AI生成我的世界

UP 主Likely7Ai B 站空间 ↗
游戏开发

参战9 款 集数5 播放36 万 更新2026-07-09

多模型挑战生成《我的世界》,方块世界现场开造,挖矿建房全凭代码!

Claude Fable 5当前榜首
概览 · 排名 · 视频墙 排名 9 条 · 视频 5 集
主题概览 各集合计 · 口径见 01 区
参战模型9款
集数5集
累计播放36 万次
累计弹幕181条
更新2026-07-09
标签游戏开发
本主题排名 UP 主自报名次
#模型版本厂商
1 Claude Fable 5 Anthropic
2 Claude Opus 5 Anthropic
3 GLM-5.2 Z.ai
4 Grok 4.5 SpaceX
5 GPT-5.5 OpenAI
6 Kimi K2.7 Code Moonshot
7 Seed-2.1 pro
8 Gemini 3.1 Pro Google
9 Seed-2.1 turbo
测评视频 5 集 · 整卡点击跳 B 站

GTA5的19.8亿次if循环修复

UP 主人工大黑 B 站空间 ↗
编程开发
测评维度总分运行速度

参战32 款 集数1 播放13 万 更新2026-05-20

让AI修复GTA5的19.8亿次if循环,看谁优化最强!

GPT-6 Astra当前榜首
概览 · 排名 · 视频墙 排名 32 条 · 视频 1 集
主题概览 各集合计 · 口径见 01 区
参战模型32款
集数1集
累计播放13 万次
累计弹幕729条
更新2026-05-20
标签编程开发
本主题排名 UP 主自报名次 · 列头为该主题自定义维度
#模型版本厂商总分运行速度
1 GPT-6 Astra OpenAI 98分0.555s
2 DeepSeek-V4-Pro DeepSeek 96分0.025s
3 DeepSeek V4.1 Flash DeepSeek 95分0.025s
4 Claude Fable 5.1 Anthropic 93分0.545s
5 GPT-5.5 OpenAI 91分0.532s
6 Claude Opus 4.8 Anthropic 90分0.55s
7 Claude Opus 4.7 Anthropic 89分0.548s
8 Qwen3.7-Max Alibaba 88分0.620s
9 GLM-5.1 Z.ai 88分0.558s
10 Gemini 3.1 Pro Google 87分0.549s
11 Kimi K2.6 Moonshot 82分0.016s
12 MiniMax M3 MiniMax 82分0.535s
13 GLM-5.3-Flash Z.ai 77分0.553s
14 GLM-5.3 Z.ai 77分0.561s
15 Claude Opus 5 Anthropic 75分0.539s
16 Grok 4.6 SpaceX 71分0.014s
17 Claude Sonnet 5 Anthropic 66分0.023s
18 MiMo v2.5 pro Xiaomi 66分0.563s
19 DeepSeek-V4-Flash DeepSeek 64分0.560s
20 MiniMax M2.7 MiniMax 60分7.290s
21 Gemini 3.8 Flash Google 54分13.706s
22 Qwen3.6-Plus Alibaba 52分0.021s
23 GPT-5.6 Sol OpenAI 50分0.531s
24 Qwen3.5-395B Alibaba 42分17.700s
25 Ring 1T AntGroup 38分13.710s
26 Step 3.7 Flash StepFun 38分Exit 133
27 Seed-2.0 pro ByteDance 32分14.126s
28 Step 3.5 flash StepFun 24分0.017s
29 Hy 3 preview Tencent 22分13.861s
30 Qwen3.6-35B-A3B Alibaba 20分14.924s
31 Qwen3.6-27B Alibaba 18分17.700s
32 GPT-OSS-120B OpenAI 14分13.808s
测评视频 1 集 · 整卡点击跳 B 站
04参考榜 · LMArena / Artificial Analysis 对照源 · 与上方 B 站榜互不混算
MODE: SNAPSHOT 数据截至:2026/9/21 19:20:44 源:LMArena·总榜 329 条 · LMArena·文档 41 条 · LMArena·搜索 34 条 · LMArena·智能体 并入 45 条(源 46 行) · Artificial Analysis 并入 77 条(源 82 行) 参考源:LMArena(众包对战 ELO)与 Artificial Analysis(标准化题库跑分)——默认按 AA 展示与排序,仅供对照。综合(票选)名次由本站按各源名次折算,不代表任何一家官方名次,也不与上方 B 站榜混算,不构成任何购买建议。

综合(票选)分怎么来的:按各源名次等权折算 —— 源内第 1 名拿 100 票分、末名趋近 0,取所在源票分的平均值;双源都覆盖的模型吃两票。它只用于跨源对照,不代表任何一家的官方名次,也不能理解为「模型的绝对实力」(完整口径见表格下方)。

厂商 ↗ ↗ ▾
1 Claude Fable 5.1 Max Anthropic 99.4 1498±8 5,783 53.4
2 Gpt 6 Astra Max OpenAI 95.8 1480±12 2,693 52.7
3 GPT-6 Astra (xhigh) OpenAI 97.4 — — 52.4
4 Claude Opus 5 High Anthropic 96.7 1493±4 42,617 49.7
5 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic 94.7 — — 48.9
6 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) Anthropic 93.4 — — 46.8
7 Step 5 PreviewCN StepFun 92.1 — — 43.7
8 Grok 4.6 High xAI 86.4 1456±6 15,521 42.8
9 Glm 5.3 FlashCN Z AI 90.5 1475±7 10,038 41.8
10 muse-spark-1.2 (xHigh) Meta 93.6 1500±11 3,227 39.6
11 Claude Opus 5 Max Anthropic 91.4 1487±5 20,706 39.4
12 Gpt 5.5 OpenAI 88.7 1476±4 66,317 38.4
13 Claude Sonnet 5 High Anthropic 84.8 1461±5 35,301 38.2
14 Gpt 5.6 Luna Xhigh OpenAI 82.0 1452±5 28,547 37.3
15 Gpt 5.6 Sol Xhigh OpenAI 88.2 1483±5 27,069 33.5
16 Gemini 3.5 Flash High Google 86.5 1478±4 38,257 32.6
17 Claude Opus 4 7 Anthropic 88.6 1494±4 61,128 30.9
18 Apodex 1.1 Apodex 77.6 — — 30.4
19 Gpt 5.6 Terra Xhigh OpenAI 81.8 1466±5 28,119 30.1
20 Minimax M3CN MiniMax 75.9 1441±4 48,540 29.2
21 Nex-N2-Pro (based on Qwen3.5-397B-A17B)CN Nex AGI 72.4 — — 28.2
22 Solar Pro4 Upstage 62.5 1376±12 2,420 28.2
23 Glm 5CN Z AI 77.5 1458±4 27,605 27.9
24 Grok Build 0.1 0616 xAI 69.7 — — 27.2
25 Claude Opus 4 6 Anthropic 83.5 1497±3 75,878 26.4
26 Mimo V2.5 ProCN 小米 77.3 1467±4 60,919 26.0
27 Mimo V2.5CN 小米 69.5 1434±4 44,466 25.2
28 Grok 4.20 0309 (Reasoning) xAI 64.5 — — 25.2
29 Mimo V2 OmniCN 小米 67.1 1430±6 19,414 25.1
30 Thinking Machines Thinking Machines 69.2 1440±5 25,922 25.0

#1Claude Fable 5.1 MaxAnthropic·综合 99.4·总榜 1498±8(5,783 票)·AA 智能指数 53.4

#2Gpt 6 Astra MaxOpenAI·综合 95.8·总榜 1480±12(2,693 票)·AA 智能指数 52.7

#3GPT-6 Astra (xhigh)OpenAI·综合 97.4·AA 智能指数 52.4

#4Claude Opus 5 HighAnthropic·综合 96.7·总榜 1493±4(42,617 票)·AA 智能指数 49.7

#5Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic·综合 94.7·AA 智能指数 48.9

#6Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic·综合 93.4·AA 智能指数 46.8

#7Step 5 PreviewCNStepFun·综合 92.1·AA 智能指数 43.7

#8Grok 4.6 HighxAI·综合 86.4·总榜 1456±6(15,521 票)·AA 智能指数 42.8

#9Glm 5.3 FlashCNZ AI·综合 90.5·总榜 1475±7(10,038 票)·AA 智能指数 41.8

#10muse-spark-1.2 (xHigh)Meta·综合 93.6·总榜 1500±11(3,227 票)·AA 智能指数 39.6

#11Claude Opus 5 MaxAnthropic·综合 91.4·总榜 1487±5(20,706 票)·AA 智能指数 39.4

#12Gpt 5.5OpenAI·综合 88.7·总榜 1476±4(66,317 票)·AA 智能指数 38.4

#13Claude Sonnet 5 HighAnthropic·综合 84.8·总榜 1461±5(35,301 票)·AA 智能指数 38.2

#14Gpt 5.6 Luna XhighOpenAI·综合 82.0·总榜 1452±5(28,547 票)·AA 智能指数 37.3

#15Gpt 5.6 Sol XhighOpenAI·综合 88.2·总榜 1483±5(27,069 票)·AA 智能指数 33.5

#16Gemini 3.5 Flash HighGoogle·综合 86.5·总榜 1478±4(38,257 票)·AA 智能指数 32.6

#17Claude Opus 4 7Anthropic·综合 88.6·总榜 1494±4(61,128 票)·AA 智能指数 30.9

#18Apodex 1.1Apodex·综合 77.6·AA 智能指数 30.4

#19Gpt 5.6 Terra XhighOpenAI·综合 81.8·总榜 1466±5(28,119 票)·AA 智能指数 30.1

#20Minimax M3CNMiniMax·综合 75.9·总榜 1441±4(48,540 票)·AA 智能指数 29.2

#21Nex-N2-Pro (based on Qwen3.5-397B-A17B)CNNex AGI·综合 72.4·AA 智能指数 28.2

#22Solar Pro4Upstage·综合 62.5·总榜 1376±12(2,420 票)·AA 智能指数 28.2

#23Glm 5CNZ AI·综合 77.5·总榜 1458±4(27,605 票)·AA 智能指数 27.9

#24Grok Build 0.1 0616xAI·综合 69.7·AA 智能指数 27.2

#25Claude Opus 4 6Anthropic·综合 83.5·总榜 1497±3(75,878 票)·AA 智能指数 26.4

#26Mimo V2.5 ProCN小米·综合 77.3·总榜 1467±4(60,919 票)·AA 智能指数 26.0

#27Mimo V2.5CN小米·综合 69.5·总榜 1434±4(44,466 票)·AA 智能指数 25.2

#28Grok 4.20 0309 (Reasoning)xAI·综合 64.5·AA 智能指数 25.2

#29Mimo V2 OmniCN小米·综合 67.1·总榜 1430±6(19,414 票)·AA 智能指数 25.1

#30Thinking MachinesThinking Machines·综合 69.2·总榜 1440±5(25,922 票)·AA 智能指数 25.0

本区块为参考源。默认视图与排序都按 AA 走,想看 LMArena 的口碑票数, 用上方「源」下拉切过去;AA 目前收录的模型比 LMArena 少(当前快照约 80 余款),想看更长的榜单请切「全部」。 表格 # 列为当前视图下的位次(1…N,随筛选与排序变化);点 # 表头即改为按综合(票选)名次排序。 综合(票选):本站按各源名次等权折算——源内第 1 名拿 100 票分、末名趋近 0, 取所在源票分的平均值,双源都覆盖的模型吃两票;它只用于跨源对照,不代表任何一家的官方名次。 分类沿用各源原生口径:LMArena 总榜/文档/搜索/智能体(agent 榜为通过率百分比), AA 综合智能/编码/Agent;地区按厂商归属可筛;年份:2025 及以前发布的模型已过滤 (无法判年的极老条目除外)。Elo 后带 * 为初步数据,票数几千的行位次会漂。 数据抓取自两家公开榜单页(链接见表格列头),缓存由 Cloudflare Worker 每 6 小时刷新, 源站每天只被访问 4 次,浏览器端无任何抓取行为。