oMLX 是面向 Apple Silicon Mac 的本地大模型推理服务器,核心卖点是”为 AI 编程代理优化”:它把 KV 缓存按块持久化到 SSD(Paged SSD KV Caching),当 Claude Code、OpenClaw、Cursor 等编码代理在会话中反复切换上下文时,已缓存的前缀从磁盘毫秒级恢复而无需重算,长上下文的首 token 延迟从 30-90 秒降到 5 秒以内。它还支持连续批处理(8 并发下生成速度最高提升 4.14 倍)、多模型同时加载(LLM/VLM/嵌入/重排序)、OpenAI 与 Anthropic 兼容 API 双端点,以及全主流工具调用格式与 MCP 集成。oMLX 是 macOS 原生菜单栏应用,开源(Apache 2.0)免费,直接复用 Hugging Face 缓存,无需重复下载模型。

功能特点
-
SSD 分页 KV 缓存:缓存块持久化到磁盘,跨请求与重启恢复,长上下文 TTFT 低于 5 秒
-
连续批处理:多并发请求同时处理,8 并发下生成速度最高提升 4.14 倍
-
macOS 原生菜单栏应用:启动/停止/监控,内置 Web 仪表盘管理模型与实时指标
-
多模型同时服务:LLM、VLM、嵌入与重排序模型共存,内存不足自动 LRU 淘汰
-
OpenAI + Anthropic 双兼容 API:Claude Code、OpenClaw、Cursor 一键接入
-
工具调用 + MCP:支持 JSON、Qwen、Gemma、GLM、MiniMax 等全部主流格式
优点
-
长上下文场景性能远超 Ollama/LM Studio(TTFT 从 30-90s 降至 5s 内)
-
本地运行,数据不出机器,隐私安全
-
Apache 2.0 开源免费,直接复用 Hugging Face 缓存免重复下载
-
为编码代理专门优化,工具调用可靠性高
缺点
-
仅支持 Apple Silicon(M1+)与 macOS 15+,无 Windows/Linux 版本
-
大模型流畅运行推荐 64GB+ 内存,硬件门槛较高
-
依赖 MLX 生态,非 MLX 格式模型需转换
主要应用场景
-
Claude Code、Cursor、OpenClaw 等编码代理的本地推理后端
-
本地私有化大模型推理,避免云端数据外流
-
长上下文任务(代码库理解、长文档分析)加速
-
多模型对比测试与开发调试
使用方法
-
访问 omlx.ai 下载 DMG 或从源码安装
-
拖入 Applications,按欢迎页配置模型目录并启动服务
-
从 Web 仪表盘下载所需模型(复用 Hugging Face 缓存)
-
在仪表盘复制对应工具(Claude Code/Cursor)的一键配置命令
-
粘贴到终端即可把 oMLX 作为本地推理后端使用
收费标准
-
Apache 2.0 开源免费,本地运行无订阅费用
-
模型免费,仅需自行承担硬件成本
相关导航
暂无评论...
