Qué venimos aprendiendo
Publicamos lo que medimos, incluido lo que nos salió mal. Cada nota la firma quien la escribió y dice sobre cuántos casos está hecha, porque una conclusión sin su tamaño de muestra es una anécdota.
Por qué un modelo general no sabe de vino
Medimos 400 descripciones de vino generadas por modelos de propósito general contra las correcciones de doce sommelieres. El 38% tenía al menos un error fáctico.
El vacío no es flank steak
Un mapa de cortes argentinos hecho con parrilleros de cinco provincias, y por qué la traducción automática de cortes es el error más caro de una carta bilingüe.
La voz del local no es un adjetivo en un prompt
Por qué pedirle a un modelo que sea «cálido y cercano» no cambia nada, y qué sí lo cambia. Trabajo con maîtres sobre 1.200 respuestas a reseñas.
Cómo medimos si el modelo mejoró
Nuestra metodología de evaluación: revisión a ciegas por pares, tasa de error fáctico y una prueba de personalidad que los modelos generales reprueban.