AI编程工具

oMLX

是面向 Apple Silicon Mac 的本地大模型推理服务器

标签:
oMLX 是面向 Apple Silicon Mac 的本地大模型推理服务器,核心卖点是”为 AI 编程代理优化”:它把 KV 缓存按块持久化到 SSD(Paged SSD KV Caching),当 Claude Code、OpenClaw、Cursor 等编码代理在会话中反复切换上下文时,已缓存的前缀从磁盘毫秒级恢复而无需重算,长上下文的首 token 延迟从 30-90 秒降到 5 秒以内。它还支持连续批处理(8 并发下生成速度最高提升 4.14 倍)、多模型同时加载(LLM/VLM/嵌入/重排序)、OpenAI 与 Anthropic 兼容 API 双端点,以及全主流工具调用格式与 MCP 集成。oMLX 是 macOS 原生菜单栏应用,开源(Apache 2.0)免费,直接复用 Hugging Face 缓存,无需重复下载模型。
oMLX

功能特点

  • SSD 分页 KV 缓存:缓存块持久化到磁盘,跨请求与重启恢复,长上下文 TTFT 低于 5 秒
  • 连续批处理:多并发请求同时处理,8 并发下生成速度最高提升 4.14 倍
  • macOS 原生菜单栏应用:启动/停止/监控,内置 Web 仪表盘管理模型与实时指标
  • 多模型同时服务:LLM、VLM、嵌入与重排序模型共存,内存不足自动 LRU 淘汰
  • OpenAI + Anthropic 双兼容 API:Claude Code、OpenClaw、Cursor 一键接入
  • 工具调用 + MCP:支持 JSON、Qwen、Gemma、GLM、MiniMax 等全部主流格式

优点

  • 长上下文场景性能远超 Ollama/LM Studio(TTFT 从 30-90s 降至 5s 内)
  • 本地运行,数据不出机器,隐私安全
  • Apache 2.0 开源免费,直接复用 Hugging Face 缓存免重复下载
  • 为编码代理专门优化,工具调用可靠性高

缺点

  • 仅支持 Apple Silicon(M1+)与 macOS 15+,无 Windows/Linux 版本
  • 大模型流畅运行推荐 64GB+ 内存,硬件门槛较高
  • 依赖 MLX 生态,非 MLX 格式模型需转换

主要应用场景

  • Claude Code、Cursor、OpenClaw 等编码代理的本地推理后端
  • 本地私有化大模型推理,避免云端数据外流
  • 长上下文任务(代码库理解、长文档分析)加速
  • 多模型对比测试与开发调试

使用方法

  1. 访问 omlx.ai 下载 DMG 或从源码安装
  2. 拖入 Applications,按欢迎页配置模型目录并启动服务
  3. 从 Web 仪表盘下载所需模型(复用 Hugging Face 缓存)
  4. 在仪表盘复制对应工具(Claude Code/Cursor)的一键配置命令
  5. 粘贴到终端即可把 oMLX 作为本地推理后端使用

收费标准

  • Apache 2.0 开源免费,本地运行无订阅费用
  • 模型免费,仅需自行承担硬件成本

相关导航

暂无评论

暂无评论...