Skip to content
research

A IA de 975B de Parâmetros que Ouve Áudio Bruto

A ex-CTO da OpenAI, Mira Murati, acaba de lançar o Inkling, um modelo de pesos abertos com 975B de parâmetros. Sua capacidade única de processar áudio bruto e seu foco em fine-tuning hiperespecífico podem mudar a forma como as empresas constroem IA.

Aki Tanaka
A IA de 975B de Parâmetros que Ouve Áudio Bruto

Ex-CTO da OpenAI Lança um Colosso de 975B de Parâmetros

A ex-CTO da OpenAI, Mira Murati, lançou a Thinking Machines, uma startup de US$ 12 bilhões pronta para desafiar o cenário do desenvolvimento de IA fechada. Seu empreendimento defende modelos de pesos abertos poderosos, visando democratizar capacidades avançadas de IA e fornecer às empresas controle e personalização inigualáveis sobre seus sistemas inteligentes.

A oferta inaugural da Thinking Machines, o Inkling, é uma presença formidável com 975 bilhões de parâmetros. Essa escala impressionante é gerenciada por meio de uma arquitetura sofisticada de Mixture-of-Experts (MoE), onde apenas 41 bilhões de parâmetros são ativamente engajados para qualquer token, equilibrando potência com eficiência computacional. Lançado sob uma licença permissiva Apache 2.0, os pesos completos do Inkling estão abertamente acessíveis no Hugging Face.

Crucialmente, a Thinking Machines posiciona o Inkling não como um concorrente de IA de uso geral, mas como um modelo de base estratégico. Embora possa não superar todos os benchmarks de amplo espectro, seu design se destaca como um ponto de partida para aplicações especializadas. O verdadeiro potencial do Inkling é desbloqueado por meio de fine-tuning personalizado, facilitado exclusivamente pela plataforma Tinker, capacitando desenvolvedores a criar soluções altamente adaptadas para tarefas específicas e de alto volume.

Esta IA Ouve Som, Ela Não Lê Transcrições

O Inkling diverge drasticamente dos modelos multimodais convencionais ao ignorar o pré-processamento para entradas não textuais. Em vez de transcrever áudio para texto ou descrever imagens com um codificador de visão separado, ele ingere áudio bruto como espectrogramas e imagens como patches de 40x40 pixels diretamente. Estes são então processados junto com tokens de texto em um espaço representacional unificado.

Esta arquitetura inovadora teoricamente minimiza a perda de dados e a compressão inerentes aos métodos tradicionais, onde a informação é inevitavelmente perdida durante a conversão de dados sensoriais ricos em um intermediário textual. Isso permite que o Inkling perceba as nuances do som, como o estilo de fala, não apenas seu conteúdo semântico.

A Thinking Machines é transparente sobre o desempenho geral do Inkling. Embora supere o GLM 5.2 em seguimento de instruções (79,8 a 73,3), ele tem um desempenho significativamente inferior em tarefas agenticas do Terminal-Bench (63,8 a 82,7). Isso indica proficiência na execução de comandos diretos, mas uma resolução de problemas autônoma mais fraca.

Tais resultados de benchmark reforçam o design do Inkling como um especialista em fine-tuning, não um generalista. Sua força reside em fornecer uma base robusta e consciente de dados brutos para tarefas altamente específicas e de alto volume, particularmente aquelas que envolvem entradas de áudio ou visuais diferenciadas, em vez de um raciocínio amplo e não supervisionado.

Por que o Fine-Tuning é o Verdadeiro Superpoder do Inkling

O verdadeiro poder do Inkling emerge por meio do fine-tuning, não do desempenho geral bruto. Esse processo ensina aos modelos como responder — moldando o tom, o formato e a adesão a estruturas de saída específicas, em vez de transmitir novos conhecimentos factuais.

Considere a Harvey AI, que realizou o fine-tuning de um modelo menor para extrair citações jurídicas. Este modelo especializado viu sua pontuação F1 melhorar de 0,56 para 0,68. Ele também igualou ou superou o GPT-4.0 em 93% dos casos, tudo isso operando de forma mais rápida e econômica.

A plataforma Tinker da Thinking Machines simplifica essa personalização, permitindo uma adaptação rápida e específica para cada tarefa. Uma demonstração convincente mostrou o Inkling realizando um ajuste fino em si mesmo para exibir 'epsilonfobia'—nunca usando a letra 'e'—ao solicitar que o modelo corrigisse automaticamente seus dados de treinamento e executasse todo o processo de ajuste fino. As respostas resultantes, apesar da restrição linguística, ainda faziam um sentido notável.

A base dessa eficiência é a Low-Rank Adaptation (LoRA). O LoRA congela os 975 bilhões de parâmetros originais e injeta matrizes leves e menores para capturar dados novos e específicos. Essa abordagem reduz drasticamente o custo e o tempo de personalização em comparação com o retreinamento de um modelo inteiro, tornando a IA personalizada acessível para aplicações de nicho.

Essa adaptação direcionada significa que as empresas podem criar agentes altamente especializados para tarefas restritas e de alto volume. Para aqueles interessados em explorar a arquitetura de pesos abertos do Inkling e obter mais detalhes, seus recursos estão disponíveis em thinkingmachines/Inkling - Hugging Face.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Quando você deve realmente usar o Inkling?

O Inkling não foi projetado como um cavalo de batalha generalista; seus criadores na Thinking Machines reconhecem abertamente que seu desempenho em benchmarks amplos, como o Terminal-Bench, fica atrás dos modelos de fronteira. Para tarefas abrangentes e não especializadas, as IAs de código fechado estabelecidas continuam sendo a escolha principal. No entanto, para um trabalho restrito e de alto volume, apoiado por dados rotulados robustos, o Inkling surge como um concorrente formidável, criado especificamente para um ajuste fino profundo.

Na plataforma Tinker, o Inkling ocupa dois nichos únicos. É o único modelo capaz de processar áudio bruto diretamente como espectrogramas, evitando a perda de dados inerente à transcrição de texto. Essa abordagem direta permite uma análise sem precedentes das propriedades intrínsecas do som. Além disso, os usuários podem ajustar finamente seu esforço de raciocínio com um controle deslizante granular de 0 a 1, oferecendo um controle muito além das configurações típicas de baixo, médio ou alto encontradas em outros modelos.

A escolha do Inkling depende da especificidade da sua aplicação. Ele se destaca em tarefas de áudio especializadas, como ditado médico, aprendendo com destreza nomes complexos de medicamentos ou realizando uma classificação sofisticada de estilo de fala para discernir como algo foi dito. Quando a personalização profunda, a análise direta de áudio e o fine-tuning de um modelo para uma função precisa e repetível são os objetivos principais, o Inkling oferece uma solução de pesos abertos inigualável.

Perguntas Frequentes

O que é o modelo de IA Inkling?

O Inkling é um modelo Mixture-of-Experts (MoE) de 975 bilhões de parâmetros e pesos abertos da Thinking Machines, uma startup fundada pela ex-CTO da OpenAI, Mira Murati. Ele foi projetado principalmente para ajuste fino em tarefas específicas.

Como o Inkling processa áudio e imagens de forma diferente?

Ao contrário dos modelos que primeiro convertem áudio/imagens em descrições de texto, o Inkling processa dados brutos diretamente. Ele ingere áudio como espectrogramas e imagens como patches de pixels, misturando-os com tokens de texto para reduzir a perda de dados e melhorar a fidelidade.

O Inkling é melhor que o GPT-4?

O Inkling não foi projetado para ser um modelo geral mais forte que o GPT-4. Sua força reside em ser um modelo base altamente eficaz para ajuste fino em tarefas restritas e específicas, onde uma versão personalizada pode superar modelos gerais tanto em precisão quanto em eficiência.

O que é a plataforma Tinker?

Tinker é a plataforma da Thinking Machines projetada para personalizar e realizar o ajuste fino de modelos de IA como o Inkling. Ela simplifica o processo de adaptação de um modelo a uma tarefa altamente específica, usando técnicas como LoRA para um treinamento com bom custo-benefício.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only