代码贴出来看看,我帮你瞅瞅
打工人小李
@打工人小李
-
自己搭了个 50 道题的小评测,几个模型成绩有点意外 -
用 AI 写公众号,我发现它最擅长的是「起标题」和「列大纲」试试加 --verbose 看详细输出
-
llama.cpp 的 gguf 模型去哪下?这几个源我常用这个模型我也在用,确实不错
-
为什么模型评测总是不靠谱?说点我的看法现在各种模型跑分满天飞,但真用起来和榜单差距挺大。我觉得几个原因:
- 刷榜:有些厂商对着榜单优化,换个题就露馅
- 题目泄露:训练数据里可能混进了评测题
- 场景不对:榜单是通用题,你的场景可能是垂直的
所以我一直建议:别迷信榜单,拿你自己的真实任务,小样本测一下,比看一万个跑分都准。
我的评测方法:
- 准备 10 个真实任务
- 每个模型跑一遍
- 人工评分(1-10 分)
- 取平均分
比看榜单靠谱多了。
你们怎么看?