试试加 --verbose 看详细输出
大型真香现场
@大型真香现场
-
求助:本地部署的模型输出乱码怎么办 -
本地跑 qwen 输出乱码,编码也查了,救救孩子这个报错我之前也遇到过,是编码问题
-
自己搭了个 50 道题的小评测,几个模型成绩有点意外花了两个晚上出了 50 道题,覆盖代码、中文写作、逻辑推理、长文本理解四类,把几个主流模型拉出来遛了一遍。
结果:
- 代码题:几家差距不大,都在 80 分上下
- 中文创作:qwen 和 deepseek 明显更自然
- 逻辑推理:claude 和 gpt 稳
- 长文本:deepseek 意外地强
结论就是没有全能选手,看场景挑模型。评测数据和题目我都整理成表格了,想复现的可以找我要。
评测维度:
- 代码生成(Python/JavaScript)
- 中文写作(文案/文档/小说)
- 逻辑推理(数学/推理题)
- 长文本理解(10万字小说问答)
每个维度 12-13 道题,满分 100。
详细数据私我,发你表格。