Skip to content
research

Un pato robot obtuvo un cerebro de IA de 15 MB

Un modelo diminuto enseñó a un pato simulado cuándo obedecer, negarse o enfadarse, y realizó el trabajo sin conexión. Lo sorprendente es cuánto puede cambiar el comportamiento con unos pocos minutos de ajuste fino.

Aki Tanaka
Un pato robot obtuvo un cerebro de IA de 15 MB

El pato obedece, pero solo si dices por favor

Un pato robot simulado camina, baila o reacciona solo cuando un cerebro de IA de 15 MB, Needle 3, asigna una solicitud en lenguaje natural a una de las cinco herramientas disponibles. Esta demostración, de Better Stack, muestra una versión personalizada del modelo base compacto de Cactus Compute operando un Open Duck Mini virtual, un modelo simulado por física.

Needle 3 no es un chatbot; no conversa ni controla la mecánica de caminar del pato. En su lugar, un controlador aprendido por separado maneja el movimiento del pato, mientras que Needle elige la acción (por ejemplo, caminar, girar, expresar emoción, bailar, sacudir la cabeza). La tarea específica del modelo es enviar estas herramientas, incluso respondiendo a matices como requerir un "por favor" para los comandos.

Este diseño enfocado permite que el modelo sea increíblemente pequeño y eficiente. La versión de 4 capas utilizada en la demostración tiene solo 15 megabytes, lo que la hace adecuada para la ejecución local en dispositivos de borde (edge devices). Este experimento destaca la edge AI práctica, donde el envío de herramientas limitado puede ejecutarse sin conexión, ofreciendo una capacidad de respuesta inmediata en el dispositivo sin conectividad a la nube.

Needle 3 de Cactus Compute, parte de su familia de modelos de llamada a herramientas, varía de 8 MB a 29 MB. Su arquitectura de "escalera de inteligencia" permite a los desarrolladores seleccionar una porción del modelo de 121 millones de parámetros (con un cómputo equivalente a 50 millones de parámetros) para adaptarse a diversos hardware, desde teléfonos hasta microcontroladores. Esto permite capacidades de IA local en dispositivos como el Pebble Index 01 Smart Ring.

Un modelo, segmentado para adaptarse al dispositivo

Needle 3 introduce una "escalera de inteligencia", un modelo de 20 capas diseñado para una implementación flexible. Los desarrolladores pueden tomar cualquier porción de prefijo, de 2 a 20 capas, y cada una funciona como un modelo independiente. Esto permite que una sola descarga de modelo sirva a diversos hardware, desde pequeños microcontroladores hasta teléfonos inteligentes más potentes.

El Needle 3 completo cuenta con 121 millones de parámetros, un salto significativo desde los 45 millones de Needle 2. Sin embargo, más de la mitad de estos parámetros residen en una tabla de búsqueda de n-gramas. Esta elección de diseño minimiza las operaciones aritméticas, manteniendo el perfil de cómputo práctico más cerca de un modelo de 50 millones de parámetros, según Cactus Compute.

Esta arquitectura crea una compensación directa: las porciones más grandes ofrecen capacidades mejoradas, mientras que las más pequeñas se adaptan a dispositivos con restricciones de hardware estrictas. Needle está diseñado explícitamente como un despachador de llamadas a herramientas, no para conversaciones abiertas. Destaca en la asignación de comandos de lenguaje natural a un conjunto predefinido de acciones, extrayendo parámetros en JSON estructurado o generando incrustaciones de texto para búsqueda local.

Su función dirigida permite una eficiencia notable. Por ejemplo, Cactus informa que una versión de 4 capas, con solo 29 millones de parámetros, puede superar a DeepSeek V4 Flash en tareas específicas después de un ajuste fino. Esta especialización permite que Needle 3 se ejecute en dispositivos con recursos limitados como el Pebble Index 01 Smart Ring, ejecutando comandos de voz sin conexión.

Enseñando modales con 1,700 ejemplos

Enseñar modales al pato robot requirió un conjunto claro de reglas para sus cinco herramientas disponibles: caminar, girar, expresar emoción, bailar y sacudir la cabeza. El pato fue entrenado para:

  • Obedecer solicitudes que contengan "por favor".
  • Rechazar comandos directos sacudiendo la cabeza.
  • Expresar enojo ante insultos o amenazas, incluso si se usó "por favor".
  • Reaccionar a eventos dramáticos sin necesidad de "por favor".
  • No realizar ninguna llamada de herramienta para tareas que no podía realizar, como configurar un temporizador.

Para inculcar estos comportamientos, el creador generó aproximadamente 1,700 ejemplos de entrenamiento. Cada ejemplo emparejó una instrucción en lenguaje natural con la respuesta de herramienta deseada, asegurando que el modelo aprendiera los conceptos subyacentes en lugar de memorizar frases exactas. Por ejemplo, "finge estar asustado, por favor" se asignó a un emote de miedo, mientras que "necesito que me recuerdes comprar leche" no resultó en ninguna llamada, ya que esa función no existe.

Se reservó un conjunto separado de 49 instrucciones escritas a mano para probar la generalización del modelo, asegurando que pudiera aplicar sus "modales" aprendidos a situaciones novedosas. Para más información sobre la tecnología subyacente, consulte Needle 3 - Foundation Model for Tiny Devices - Cactus Compute.

El proceso de ajuste fino (fine-tuning) se llevó a cabo en una estación de trabajo RTX 5090. Entrenar el modelo completo Needle 3 de 20 capas tomó aproximadamente 12.5 minutos, mientras que una versión más pequeña de 4 capas (aproximadamente 15 megabytes) se completó en unos 5 minutos. Una advertencia clave de este ajuste fino local fue la pérdida de la puntuación de confianza del modelo, una característica típicamente disponible en la plataforma alojada de Cactus Compute.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

El modelo pequeño gana, aunque por un margen más estrecho

Los resultados de las pruebas reservadas mostraron claramente el beneficio del ajuste fino. El modelo base Needle 3 sin ajustar obtuvo un escaso 13 de 49 en las instrucciones de prueba. El modelo completo de 20 capas ajustado logró 41 de 49, una mejora significativa.

La versión de cuatro capas de aproximadamente 15MB obtuvo 30 de 49, un rendimiento respetable para su tamaño pero aún considerablemente menor que el modelo completo. Este modelo más pequeño a veces malinterpretó una instrucción no relacionada, dando una reacción extraña, o no logró identificar el enojo del pato ante los insultos. El rendimiento depende en gran medida de la tarea específica y la calidad de los ejemplos de entrenamiento.

Estos fallos moderan la historia: aunque impresionante, las capacidades del modelo pequeño no son universales. Su éxito con los modales del pato destaca su diseño especializado como un despachador de llamadas a herramientas, no como un motor de razonamiento general.

La verdadera conclusión para la edge AI es el potencial de los despachadores especializados que se ejecutan localmente. Pueden manejar tareas específicas y restringidas de manera eficiente en dispositivos pequeños. Sin embargo, las afirmaciones de los benchmarks y las demostraciones impresionantes no deben confundirse con una capacidad de razonamiento amplia o un rendimiento garantizado del producto.

Preguntas frecuentes

¿Qué es Needle 3?

Needle 3 es un modelo compacto de Cactus Compute diseñado para despachar llamadas a herramientas estructuradas en dispositivos con recursos limitados, en lugar de actuar como un chatbot general.

¿Cómo puede Needle 3 caber en un modelo de 15MB?

Su modelo de 20 capas puede dividirse en versiones independientes más pequeñas. La demostración del pato utilizó una versión ajustada de cuatro capas de aproximadamente 15MB.

¿Qué le enseñó el ajuste fino al pato robot?

Le enseñó al pato a responder a peticiones educadas, rechazar comandos directos, reaccionar ante la rudeza o situaciones dramáticas, e ignorar peticiones que exceden sus capacidades.

¿Qué tan bien funcionó el modelo del pato ajustado?

En 49 instrucciones de prueba escritas a mano, el modelo de cuatro capas obtuvo 30 aciertos, frente a 13 del modelo sin ajustar y 41 de la versión de 20 capas ajustada.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.