Skip to content
research

La IA de 975B de parámetros que escucha audio sin procesar

La ex-CTO de OpenAI, Mira Murati, acaba de lanzar Inkling, un modelo de pesos abiertos de 975B de parámetros. Su capacidad única para procesar audio sin procesar y su enfoque en el ajuste fino hiperespecífico podrían cambiar la forma en que las empresas construyen IA.

Aki Tanaka
La IA de 975B de parámetros que escucha audio sin procesar

La ex-CTO de OpenAI lanza un gigante de 975B de parámetros

La ex-CTO de OpenAI, Mira Murati, ha lanzado Thinking Machines, una startup de 12 mil millones de dólares preparada para desafiar el panorama del desarrollo de IA cerrada. Su empresa defiende los potentes modelos de pesos abiertos, con el objetivo de democratizar las capacidades avanzadas de IA y proporcionar a las empresas un control y una personalización inigualables sobre sus sistemas inteligentes.

La oferta inaugural de Thinking Machines, Inkling, es una presencia formidable con 975 mil millones de parámetros. Esta impresionante escala se gestiona a través de una sofisticada arquitectura de Mixture-of-Experts (MoE), donde solo 41 mil millones de parámetros se activan para cualquier token dado, equilibrando la potencia con la eficiencia computacional. Lanzado bajo una licencia permisiva Apache 2.0, los pesos completos de Inkling están abiertamente accesibles en Hugging Face.

Fundamentalmente, Thinking Machines posiciona a Inkling no como un competidor de IA de propósito general, sino como un modelo base estratégico. Si bien puede no superar todos los puntos de referencia de amplio espectro, su diseño sobresale como punto de partida para aplicaciones especializadas. El verdadero potencial de Inkling se desbloquea mediante el ajuste fino personalizado, facilitado exclusivamente a través de la plataforma Tinker, lo que permite a los desarrolladores crear soluciones altamente adaptadas para tareas específicas de gran volumen.

Esta IA escucha sonido, no lee transcripciones

Inkling se desvía drásticamente de los modelos multimodales convencionales al evitar el preprocesamiento para entradas no textuales. En lugar de transcribir audio a texto o describir imágenes con un codificador de visión separado, ingiere audio sin procesar como espectrogramas e imágenes como parches de píxeles de 40x40 directamente. Estos se procesan junto con los tokens de texto en un espacio representacional unificado.

Esta arquitectura novedosa minimiza teóricamente la pérdida de datos y la compresión inherentes a los métodos tradicionales, donde la información se pierde inevitablemente durante la conversión de datos sensoriales ricos en un intermediario textual. Permite a Inkling percibir los matices del sonido, como el estilo de habla, no solo su contenido semántico.

Thinking Machines es transparente sobre el rendimiento general de Inkling. Si bien supera a GLM 5.2 en el seguimiento de instrucciones (79.8 frente a 73.3), tiene un rendimiento significativamente inferior en las tareas de agentes de Terminal-Bench (63.8 frente a 82.7). Esto indica competencia en la ejecución de comandos directos, pero una resolución de problemas autónoma más débil.

Dichos resultados de referencia refuerzan el diseño de Inkling como un especialista en fine-tuning, no como un generalista. Su fortaleza radica en proporcionar una base sólida y consciente de los datos sin procesar para tareas altamente específicas y de gran volumen, particularmente aquellas que involucran entradas de audio o visuales matizadas, en lugar de un razonamiento amplio y no supervisado.

Por qué el fine-tuning es el verdadero superpoder de Inkling

El verdadero poder de Inkling surge a través del fine-tuning, no del rendimiento general bruto. Este proceso enseña a los modelos cómo responder, dando forma al tono, el formato y la adherencia a estructuras de salida específicas, en lugar de impartir nuevos conocimientos fácticos.

Considere a Harvey AI, que ajustó un modelo más pequeño para extraer citas legales. Este modelo especializado vio mejorar su puntuación F1 de 0.56 a 0.68. También igualó o superó a GPT-4.0 en el 93% de los casos, todo mientras funcionaba de manera más rápida y rentable.

La plataforma Tinker de Thinking Machines agiliza esta personalización, permitiendo una adaptación rápida y específica para cada tarea. Una demostración convincente mostró a Inkling ajustándose a sí mismo para exhibir 'epsilonfobia' —nunca usar la letra 'e'— al pedirle al modelo que corrigiera automáticamente sus datos de entrenamiento y ejecutara todo el proceso de ajuste fino. Las respuestas resultantes, a pesar de la restricción lingüística, seguían teniendo un sentido notable.

La base de esta eficiencia es Low-Rank Adaptation (LoRA). LoRA congela los 975 mil millones de parámetros originales e inyecta matrices ligeras y más pequeñas para capturar datos nuevos y específicos. Este enfoque reduce drásticamente el costo y la velocidad de personalización en comparación con el reentrenamiento de un modelo completo, haciendo que la IA personalizada sea accesible para aplicaciones de nicho.

Esta adaptación dirigida significa que las empresas pueden crear agentes altamente especializados para tareas de gran volumen y alcance limitado. Para aquellos interesados en explorar la arquitectura de pesos abiertos de Inkling y obtener más detalles, sus recursos están disponibles en thinkingmachines/Inkling - Hugging Face.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

¿Cuándo debería usar realmente Inkling?

Inkling no está diseñado como un caballo de batalla generalista; sus creadores en Thinking Machines reconocen abiertamente que su rendimiento en puntos de referencia amplios como Terminal-Bench sigue a los modelos de vanguardia. Para tareas de amplio alcance y no especializadas, las IA de código cerrado establecidas siguen siendo la opción preferida. Sin embargo, para un trabajo limitado y de gran volumen respaldado por datos etiquetados sólidos, Inkling emerge como un competidor formidable, diseñado específicamente para un ajuste fino profundo.

En la plataforma Tinker, Inkling se abre dos nichos únicos. Es el único modelo capaz de procesar audio sin procesar directamente como espectrogramas, evitando la pérdida de datos inherente a la transcripción de texto. Este enfoque directo permite un análisis sin precedentes de las propiedades intrínsecas del sonido. Además, los usuarios pueden ajustar con precisión su esfuerzo de pensamiento con un control deslizante granular de 0 a 1, ofreciendo un control mucho más allá de los ajustes típicos de bajo, medio o alto que se encuentran en otros modelos.

Elegir Inkling depende de la especificidad de su aplicación. Destaca en tareas de audio especializadas como el dictado médico, aprendiendo con destreza nombres complejos de medicamentos o realizando una clasificación sofisticada del estilo del habla para discernir cómo se dijo algo. Cuando la personalización profunda, el análisis de audio directo y el ajuste fino de un modelo para una función precisa y repetible son objetivos principales, Inkling ofrece una solución de pesos abiertos inigualable.

Preguntas frecuentes

¿Qué es el modelo de IA Inkling?

Inkling es un modelo de mezcla de expertos (MoE) de 975 mil millones de parámetros y pesos abiertos de Thinking Machines, una startup fundada por la ex-CTO de OpenAI, Mira Murati. Está diseñado principalmente para el ajuste fino en tareas específicas.

¿Cómo procesa Inkling el audio y las imágenes de manera diferente?

A diferencia de los modelos que primero convierten el audio/imágenes en descripciones de texto, Inkling procesa los datos sin procesar directamente. Ingiere audio como espectrogramas e imágenes como parches de píxeles, mezclándolos con tokens de texto para reducir la pérdida de datos y mejorar la fidelidad.

¿Es Inkling mejor que GPT-4?

Inkling no está diseñado para ser un modelo general más fuerte que GPT-4. Su fortaleza radica en ser un modelo base altamente efectivo para el ajuste fino en tareas limitadas y específicas, donde una versión personalizada puede superar a los modelos generales tanto en precisión como en eficiencia.

¿Qué es la plataforma Tinker?

Tinker es la plataforma de Thinking Machines diseñada para personalizar y ajustar modelos de IA como Inkling. Simplifica el proceso de adaptar un modelo a una tarea altamente específica, utilizando técnicas como LoRA para un entrenamiento rentable.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only