浏览文档目录
适用版本:OmniStudio 0.3.1–0.3.2

量化与 GGUF 格式

OmniStudio 桌面客户端当前主要使用 GGUF 模型。量化通过降低权重精度减少磁盘和内存占用,但量化越激进,输出质量越可能下降。

常见选择

量化 资源占用 适合场景
Q4_K_M 较低 通常是第一次使用和日常对话的平衡选择
Q5_K_M / Q6_K 中等 设备资源更充足、希望保留更多质量
Q8_0 较高 更重视质量且内存充足
F16 很高 研究、对照或明确需要高精度

模型作者不一定提供所有量化。优先选择详情页标记为 Recommended 的版本,再结合 Total download 和设备可用内存判断。

模型规模与量化不是一回事

  • 模型规模决定能力上限和主要资源需求。
  • 量化决定同一模型权重的精度与体积。
  • 后端、上下文长度和视觉投影文件也会占用内存。

因此,“某个量化文件能下载到磁盘”不等于“当前设备一定能稳定加载”。加载失败时先降低模型规模,再考虑更低量化。

多模态模型

带 Vision 标签的 GGUF 模型通常需要匹配的 mmproj。主模型和 mmproj 必须来自兼容版本;不能随意混用同家族的其他 projector。