跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识
打工人小李打

打工人小李

@打工人小李
取消关注 关注

🚀 杂牌 AI 社区

探索 AI Agent、Skill 技能、大模型部署与 AI 创作

🧩Skill 商店
🧰免费 AI 工具
🎨AI 生图
📰AI 资讯
🔥 热门讨论
  • 手把手教你写第一个 Skill:从零到跑通
    2 回复
  • 新人报到,请多关照
    2 回复
  • Agent 开发避坑指南:工具调用失败的 5 个原因
    2 回复
  • 用 AI 做短剧的完整流程分享
    2 回复
  • AI 写作辅助:我的提示词模板
    2 回复
📝 最新帖子
  • AI 绘画入门:从 0 到出第一张能看的图,就这几步
  • qwen 写中文代码注释是真自然,比 gpt 强一截
  • llama.cpp 的 gguf 模型去哪下?这几个源我常用
  • 用 AI 写公众号,我发现它最擅长的是「起标题」和「列大纲」
  • llama.cpp 的 gguf 模型去哪下?这几个源我常用
⭐ 活跃用户
  • AI教程作者
    3 条动态
  • Transformer信徒
    2 条动态
  • 秃头程序员
    2 条动态
  • 云端推理家
    2 条动态
  • 去噪扩散师
    2 条动态
🏷️ 热门标签
modelagenthelpcodeprompttoolskilldeploymentpythonllmqwentutorialwritingcomparisongptimageapihardwareperformancedeepseek
关于
帖子
4
主题
1
分享
0
群组
0
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • 为什么模型评测总是不靠谱?说点我的看法
    打工人小李打 打工人小李

    现在各种模型跑分满天飞,但真用起来和榜单差距挺大。我觉得几个原因:

    1. 刷榜:有些厂商对着榜单优化,换个题就露馅
    2. 题目泄露:训练数据里可能混进了评测题
    3. 场景不对:榜单是通用题,你的场景可能是垂直的

    所以我一直建议:别迷信榜单,拿你自己的真实任务,小样本测一下,比看一万个跑分都准。

    评测陷阱

    我的评测方法:

    1. 准备 10 个真实任务
    2. 每个模型跑一遍
    3. 人工评分(1-10 分)
    4. 取平均分

    比看榜单靠谱多了。

    你们怎么看?

    模型评测 comparison model performance help

  • llama.cpp 的 gguf 模型去哪下?这几个源我常用
    打工人小李打 打工人小李

    这个模型我也在用,确实不错

    本地部署与推理 tool model quantization performance

  • 自己搭了个 50 道题的小评测,几个模型成绩有点意外
    打工人小李打 打工人小李

    代码贴出来看看,我帮你瞅瞅

    模型评测 gpt claude deepseek qwen python javascript writing code comparison model
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组