Posts
All the articles I've posted.
-
量化、质量与速度:普通用户如何找到最佳平衡点
# 量化、质量与速度:普通用户如何找到最佳平衡点 ## 引言 '量化'是大模型圈子里出现频率最高的词之一。但你可能会困惑: - Q4_K 和 Q3_K 到底差多少? - 量化低一点真的能省那么多显存吗? - 省下来的显存用来扩大上下文...
-
Hermes Tool Search 懒加载:当模型记不住几千个工具时
部署了一个带 2000+ 工具定义的 Agent 后,prompt 比对话内容还长。Tool Search 懒加载解决了这个问题。
-
MEMOS 记忆插件接入实录:让 AI 不再「每次都是初见」
每次重启会话,模型都不记得几分钟前聊过什么。MEMOS(MemTensor)解决了这个问题——但接入过程没那么简单。
-
飞书机器人卡顿到无法使用?上下文压缩救了它
机器人越聊越慢,最后一条消息等 30 秒才回复。这不是模型推理慢,是上下文太长了。