适用版本:OmniStudio 0.3.1–0.3.2
量化与 GGUF 格式
OmniStudio 桌面客户端当前主要使用 GGUF 模型。量化通过降低权重精度减少磁盘和内存占用,但量化越激进,输出质量越可能下降。
常见选择
| 量化 | 资源占用 | 适合场景 |
|---|---|---|
Q4_K_M |
较低 | 通常是第一次使用和日常对话的平衡选择 |
Q5_K_M / Q6_K |
中等 | 设备资源更充足、希望保留更多质量 |
Q8_0 |
较高 | 更重视质量且内存充足 |
F16 |
很高 | 研究、对照或明确需要高精度 |
模型作者不一定提供所有量化。优先选择详情页标记为 Recommended 的版本,再结合 Total download 和设备可用内存判断。
模型规模与量化不是一回事
- 模型规模决定能力上限和主要资源需求。
- 量化决定同一模型权重的精度与体积。
- 后端、上下文长度和视觉投影文件也会占用内存。
因此,“某个量化文件能下载到磁盘”不等于“当前设备一定能稳定加载”。加载失败时先降低模型规模,再考虑更低量化。
多模态模型
带 Vision 标签的 GGUF 模型通常需要匹配的 mmproj。主模型和 mmproj 必须来自兼容版本;不能随意混用同家族的其他 projector。

