知行手记首页

oMLX 本地推理

分类技术笔记
oMLX 本地推理
oMLX  本地推理
# oMLX 软件作用 **oMLX 是专门针对 Apple Silicon(M系列芯片)Mac 的本地大模型推理服务器软件,基于 Apple MLX 框架开发,用来在本机离线跑大模型,主打高速缓存,尤其适合代码智能体(Cursor、Claude Code)等开发场景。** > 系统要求:macOS15+、Apple Silicon,开源 Apache2.0 协议,提供DMG桌面客户端,也可以源码部署。 ## ✨核心功能 1. **SSD分页KV缓存(最大亮点)** 传统 Ollama / LM‑Studio 的KV缓存只存在内存,对话/代码Agent频繁切换上下文就会全部失效,要重新计算,速度很慢。 oMLX把缓存分两层:高频热缓存放内存,低频冷缓存持久化保存到SSD磁盘。**缓存可以跨会话、跨服务重启复用**,二次请求响应时间从几十‑90秒降低到5秒以内,大幅提升编码Agent体验。 2. **连续批处理并发推理** 支持同时处理多个AI请求,不会一个请求阻塞其他任务,8并发下最高有4.14倍生成速度提升。 3. **兼容OpenAI / Anthropic接口** 本地服务地址 `http://localhost:8000`,提供OpenAI `/v1`、Anthropic `/v1/messages` 标准API。 可以直接对接 **Cursor、Claude Code、OpenClaw** 等AI编码工具,把这些工具的后端切换成本地模型,不用联网调用云端API。网页面板直接生成对应工具的配置命令,复制即用。 4. **多模型同时加载运行** 同时支持大语言LLM、多模态VLM视觉模型、Embedding嵌入、重排序reranker模型;内存不足自动LRU淘汰模型;可以直接在Web面板浏览下载HuggingFace模型;**兼容HuggingFace、LMStudio已下载好的模型,不用重复下载**。 5. **原生Mac桌面体验** 不是Electron套壳,原生mac菜单栏App,可以一键启停服务;内置Web管理仪表盘:看实时token吞吐、缓存效率、跑测试基准、聊天对话、管理模型、查看日志。 6. **工具调用与MCP支持** 支持主流模型的Function‑call工具调用,支持MCP协议,可对超大输出做裁剪,适配Agent工作流。 ## 🆚 和 Ollama / LM Studio 的区别 Ollama、LMStudio缓存只驻留内存,代码Agent频繁切换上下文就会清空缓存,反复重算上下文,速度慢。 oMLX核心就是**SSD持久KV缓存**,专门针对Agent、编码场景优化,解决长上下文反复重计算的痛点。 ## 🎯适合什么人 1. Mac苹果芯片开发者,想用Cursor/Claude Code跑本地大模型写代码; 2. 需要离线本地部署大模型,做多轮长上下文对话; 3. 机器内存不算特别大,希望借助SSD缓存跑更大的模型。 简单总结:**让你的Mac变成本地AI服务器,把Cursor、Claude Code这类AI开发工具切换到本地大模型,大幅降低长上下文场景的等待时间**。 如果你需要,我可以帮你整理一份简短的中文使用步骤。

以文字记录成长,以良知安顿内心

© 2026 知行手记