overview
O que é o oMLX?
oMLX é uma ferramenta de servidor de inferência LLM local desenvolvida por oMLX.ai que permite a desenvolvedores, pesquisadores de IA e usuários de Mac com Apple Silicon executar grandes modelos de linguagem localmente com desempenho aprimorado. Ele utiliza batching contínuo e um cache KV de dois níveis (RAM + SSD) para otimizar a execução local de modelos de IA. Projetado especificamente para Macs com Apple Silicon, o oMLX atua como um motor de inferência de IA especializado, suportando vários modelos de machine learning, incluindo LLMs de texto, modelos de visão-linguagem (VLMs), modelos OCR, modelos de embedding e rerankers diretamente no dispositivo do usuário. Sua gestão é integrada à barra de menu do macOS, proporcionando uma experiência de usuário nativa.
