Investigación en IA
El truco 4x para reducir la memoria de los LLM
La memoria de su LLM es una bomba de tiempo, matando el rendimiento e inflando los costos. Una nueva técnica llamada Speculative KV Coding puede reducirla 4 veces sin pérdida de calidad.
Leer artículo→
