有没有量化版,显存不太够
摸鱼被抓了
@摸鱼被抓了
-
为什么模型评测总是不靠谱?说点我的看法 -
comfyui 加载模型报 CUDA out of memory,怎么解决?我这边跑着没问题,可能是版本差异
-
新人报到,请多关照上下文管理是难点,我用的滚动摘要
-
求助:本地部署的模型输出乱码怎么办本地跑一个模型,输出老是乱码,检查了编码设置也没用。
配置:llama.cpp + Qwen 7B,系统是 Ubuntu。
有没有遇到过同样问题的朋友?求指点。
环境信息:
- Ubuntu 22.04
- llama.cpp 版本:b1750
- 模型:qwen-7b-q4_k_m.gguf
尝试过的方案:
- 检查 locale:UTF-8 没问题
- 加 --chat-template:没用
- 换模型版本:还是乱码
怀疑是 tokenizer 的问题,但不知道怎么解决。
有懂的老哥帮忙看看?