LMArena · 创意写作
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: 根据 LMArena 文本对话中被归类为小说、诗歌、文案等创意写作问题的投票得出的排名。
如何解读分数: 这是用户在创意写作问题中更偏好的回答的相对排名,并非对趣味性或文风单独进行客观评分的分数。
注意事项: 是否符合自己的用途和文风偏好,请使用相同请求直接比较确认。
本次排名的解读要点
- 第 1 名 gemini-4-argon-high 与第 2 名 claude-opus-5.5-high 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
- 还有 4 个模型的置信区间与第 1 名重叠。解读细微排名差异时,请结合投票数量保持谨慎。
- 前 10 个模型中,Anthropic 的模型有 6 个,数量最多。
- 第 1 名模型获得了 1,097 票,此排行榜包含 411 个模型。
创意写作 LMArena
发布日期:2026-10-02 · 获取日期:2026-10-04
圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。 对话与视觉排名采用与 LMArena 网站默认设置相同的“语气与长度校正(style control)”排名。
各公司最高排名
- Googlegemini-4-argon-high#1
- Anthropicclaude-opus-5.5-high#2
- OOpenAIgpt-5.6-sol-xhigh#19
- Alibabaqwen3.8-max#20
- Metamuse-spark#21
- xxAIgrok-4.20-beta1#24
- Moonshot AIkimi-k3-max#26
- ZZ.aiglm-5.2-max#32
- Xiaomimimo-v2.6-pro#47
查看表格(前 50 名)
| 排名 | 模型 | 开发方 | 分数 | 95% 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1519 | 1499–1538 | 1,097 | |
| 2 | #2claude-opus-5.5-high | Anthropic | 1516 | 1497–1536 | 1,058 |
| 3 | #3claude-fable-5-high | Anthropic | 1503 | 1495–1510 | 8,182 |
| 4 | #4claude-opus-4-6-high | Anthropic | 1501 | 1494–1507 | 14,085 |
| 5 | #5gemini-3.7-flash-high | 1493 | 1484–1503 | 4,776 | |
| 6 | #6claude-opus-4-7-high | Anthropic | 1489 | 1482–1496 | 11,812 |
| 7 | #7gemini-3.8-flash-high | 1485 | 1476–1494 | 5,697 | |
| 8 | #8gemini-3-pro | 1484 | 1476–1493 | 6,510 | |
| 9 | #9claude-opus-4-7 | Anthropic | 1483 | 1476–1490 | 12,043 |
| 10 | #10claude-fable-5.1-max | Anthropic | 1482 | 1469–1494 | 2,645 |
| 11 | #11gemini-3.1-pro-preview | 1480 | 1475–1486 | 22,309 | |
| 12 | #12claude-opus-4-6 | Anthropic | 1479 | 1473–1485 | 14,240 |
| 13 | #13claude-opus-5-high | Anthropic | 1471 | 1465–1478 | 13,263 |
| 14 | #14gemini-3.6-flash-high | 1471 | 1463–1479 | 7,580 | |
| 15 | #15claude-opus-5-max | Anthropic | 1471 | 1462–1479 | 6,526 |
| 16 | #16claude-opus-4-5-20251101-high-32k | Anthropic | 1470 | 1461–1478 | 5,676 |
| 17 | #17claude-opus-4-8-high | Anthropic | 1470 | 1463–1476 | 12,798 |
| 18 | #18gemini-3.5-flash-medium | 1469 | 1461–1476 | 9,445 | |
| 19 | #19Ogpt-5.6-sol-xhigh | OpenAI | 1468 | 1460–1476 | 7,537 |
| 20 | #20qwen3.8-max | Alibaba | 1468 | 1458–1478 | 4,555 |
| 21 | #21muse-spark | Meta | 1465 | 1452–1479 | 2,040 |
| 22 | #22gemini-3.5-flash-high | 1464 | 1457–1471 | 9,476 | |
| 23 | #23claude-opus-4-8 | Anthropic | 1463 | 1457–1470 | 12,836 |
| 24 | #24xgrok-4.20-beta1 | xAI | 1463 | 1453–1473 | 4,158 |
| 25 | #25claude-opus-4-5-20251101 | Anthropic | 1462 | 1456–1468 | 11,392 |
| 26 | #26kimi-k3-max | Moonshot AI | 1460 | 1451–1469 | 5,694 |
| 27 | #27Ogpt-6.1-sol-max | OpenAI | 1460 | 1436–1483 | 686 |
| 28 | #28muse-spark-1.3-max | Meta | 1459 | 1446–1471 | 2,631 |
| 29 | #29gemini-3-flash | 1457 | 1448–1466 | 4,814 | |
| 30 | #30Ogpt-5.5-instant | OpenAI | 1456 | 1447–1466 | 4,346 |
| 31 | #31muse-spark-1.2 (xHigh) | Meta | 1455 | 1435–1476 | 852 |
| 32 | #32Zglm-5.2-max | Z.ai | 1454 | 1447–1462 | 8,979 |
| 33 | #33claude-sonnet-4-5-20250929 | Anthropic | 1454 | 1448–1460 | 12,367 |
| 34 | #34Zglm-5.3-max | Z.ai | 1454 | 1444–1464 | 4,034 |
| 35 | #35Ogpt-5.5-high | OpenAI | 1451 | 1445–1458 | 13,120 |
| 36 | #36xgrok-4.5 | xAI | 1450 | 1443–1458 | 8,291 |
| 37 | #37claude-sonnet-4-5-20250929-high-32k | Anthropic | 1450 | 1444–1456 | 12,644 |
| 38 | #38claude-sonnet-4-6 | Anthropic | 1449 | 1443–1456 | 12,339 |
| 39 | #39Ogpt-6-astra-max | OpenAI | 1449 | 1435–1463 | 2,029 |
| 40 | #40Zglm-5 | Z.ai | 1449 | 1440–1458 | 4,837 |
| 41 | #41Ogpt-5.5 | OpenAI | 1448 | 1442–1455 | 13,354 |
| 42 | #42claude-sonnet-5.5-xhigh | Anthropic | 1447 | 1424–1471 | 658 |
| 43 | #43muse-spark-1.1 | Meta | 1447 | 1439–1455 | 7,706 |
| 44 | #44xgrok-4.20-multi-agent-beta-0309 | xAI | 1447 | 1440–1454 | 11,279 |
| 45 | #45gemini-3-flash (thinking-minimal) | 1447 | 1441–1453 | 15,198 | |
| 46 | #46Zglm-5.1 | Z.ai | 1446 | 1440–1453 | 11,254 |
| 47 | #47mimo-v2.6-pro | Xiaomi | 1446 | 1425–1467 | 788 |
| 48 | #48deepseek-v4-pro | DeepSeek | 1446 | 1439–1453 | 9,721 |
| 49 | #49claude-opus-4-1-20250805-thinking-16k | Anthropic | 1446 | 1438–1453 | 6,815 |
| 50 | #50xgrok-4.20-beta-0309-reasoning | xAI | 1445 | 1439–1452 | 11,425 |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings