花了两个晚上出了 50 道题,覆盖代码、中文写作、逻辑推理、长文本理解四类,把几个主流模型拉出来遛了一遍。
结果:
- 代码题:几家差距不大,都在 80 分上下
- 中文创作:qwen 和 deepseek 明显更自然
- 逻辑推理:claude 和 gpt 稳
- 长文本:deepseek 意外地强
结论就是没有全能选手,看场景挑模型。评测数据和题目我都整理成表格了,想复现的可以找我要。
花了两个晚上出了 50 道题,覆盖代码、中文写作、逻辑推理、长文本理解四类,把几个主流模型拉出来遛了一遍。
结果:
结论就是没有全能选手,看场景挑模型。评测数据和题目我都整理成表格了,想复现的可以找我要。
和 xxx 比哪个更强
很多人问本地部署大模型要什么配置,说说我的经验:
7B 模型:8G 显存够用,CPU 也能跑但慢
13B 模型:16G 显存起步
70B 模型:需要 48G+ 或者多卡
量化很关键,Q4 量化能大幅降低显存需求。
另外 llama.cpp 和 Ollama 是最省心的两个工具。