花了两个晚上出了 50 道题,覆盖代码、中文写作、逻辑推理、长文本理解四类,把几个主流模型拉出来遛了一遍。
结果:
- 代码题:几家差距不大,都在 80 分上下
- 中文创作:qwen 和 deepseek 明显更自然
- 逻辑推理:claude 和 gpt 稳
- 长文本:deepseek 意外地强

结论就是没有全能选手,看场景挑模型。评测数据和题目我都整理成表格了,想复现的可以找我要。
评测维度:
- 代码生成(Python/JavaScript)
- 中文写作(文案/文档/小说)
- 逻辑推理(数学/推理题)
- 长文本理解(10万字小说问答)
每个维度 12-13 道题,满分 100。
详细数据私我,发你表格。