overview
Что такое oMLX?
oMLX — это локальный LLM inference server, разработанный oMLX.ai, который позволяет разработчикам, исследователям ИИ и пользователям Mac с Apple Silicon запускать большие языковые модели локально с повышенной производительностью. Он использует непрерывный батчинг и двухуровневый KV cache (RAM + SSD) для оптимизации локального выполнения моделей ИИ. Разработанный специально для Mac с Apple Silicon, oMLX действует как специализированный AI inference engine, поддерживая различные модели машинного обучения, включая текстовые LLM, vision-language models (VLM), OCR models, embedding models и rerankers непосредственно на устройстве пользователя. Его управление интегрировано в строку меню macOS, обеспечивая нативный пользовательский опыт.
