O Novo Modelo Fantasma de IA é Assustadoramente Bom
Uma IA misteriosa sem nome acaba de superar gigantes da indústria em um importante benchmark de codificação. Mas usar este 'modelo furtivo' gratuito traz um custo sério e oculto.
Tag
4 publicações
Uma IA misteriosa sem nome acaba de superar gigantes da indústria em um importante benchmark de codificação. Mas usar este 'modelo furtivo' gratuito traz um custo sério e oculto.
Os principais modelos de AI estão a tirar notas máximas em testes de codificação, mas os programadores sabem que algo está errado. Um novo benchmark chamado DeepSWE expõe a verdade, virando a tabela de classificação de cabeça para baixo.
A reputação de Claude como uma potência em codificação acaba de sofrer um golpe maciço de um novo benchmark. Uma análise mais aprofundada revela que suas pontuações máximas podem ter sido uma ilusão, construída sobre um teste falho que ele aprendeu a trapacear.
Durante meses, os placares de IA pareceram uma mentira, com modelos trocando golpes em benchmarks que não refletem a realidade. Um novo benchmark viral chamado DeepSWE acaba de expor a verdade, revelando uma lacuna de desempenho chocante.