Internet está enardecido por Jev, un modelo de IA de TypeSafe AI que devuelve valores con tipos y estimaciones de probabilidad. La compañía afirma que es rápido y barato. La pregunta es si alguien se ha detenido a preguntar si realmente funciona.
Por qué las Puertas No Funcionan
El escritor comienza con una queja sobre las puertas. En una historia, una puerta falla porque hay un cuerpo en el camino. En otra, aproximadamente mil millones de dólares en oro bloquean el camino. El modelo de puertas del escritor es simple: las puertas no deberían «ser horribles» inexplicablemente. Cuando el personaje murmura «esta cosa estúpida es horrible», al escritor le parece hilarante, aunque admite que el problema podría ser su propio cerebro.
Jev es más rápido y económico que otros enfoques. Pero el escritor plantea una pregunta práctica: ¿qué significa saber si Jev está funcionando?
La Parte Difícil Que Nadie Verifica
El escritor compara usar Jev con obtener una cuenta FTP, montarla localmente con curlftpfs y luego usar SVN o CVS en el sistema de archivos montado. Todavía tienes que hacer la parte difícil. Para saber si Jev está funcionando, tienes que construir pruebas y una canalización de verificación de la verdad. Si tienes eso, estás en camino de construir tu propia solución.
Nadie que compre Jev está ejecutando esas pruebas. Le dan preguntas opacas al modelo y obtienen respuestas opacas. Pueden marcar la casilla de «impulsado por IA» y enviar antes del viernes. Cuando esto falla en la lógica posterior, se encogen de hombros y dicen «bueno, la IA comete errores».
Los Puntajes de Confianza Son Peores Que Nada
Jev proporciona puntajes de confianza. El escritor pregunta qué se supone que debe hacer con ellos. Necesitas saber qué tan bien están calibrados esos puntajes y cómo se ven los costos de la incertidumbre. Los propios anuncios de Jev se centran en los puntajes de referencia, no en la calibración. La documentación sugiere un umbral de 0.5 para «no hacer nada» y un umbral de 0.9 para «realizar acciones de alto riesgo», con una nota al margen que indica que los umbrales dependen del dominio y el rendimiento del modelo.
El escritor describe esto como un comportamiento de culto de carga en el mejor de los casos y una excusa para el fracaso en el peor. ¡El modelo solo tenía un 73% de confianza! Eso significa que el presupuesto de errores es del 27%.
¿Quién Asume la Responsabilidad del Fracaso
Cuando un botón falla en un sitio web, el escritor espera a alguien cuyo trabajo es entender por qué el punto final está fallando. La propiedad está bien definida, aunque sea opaca. Con Jev, la experiencia es «esto estúpido es horrible». El software ya se siente caprichoso; más fallas solo cambian la tasa de frustración.
El escritor teme que «a veces simplemente es horrible» se convierta en el punto final aceptado de las investigaciones. Eso es triste porque el desarrollo acelerado por LLM podría ayudar a resolver algunos de estos problemas. Existen flujos de trabajo de pruebas automatizados pero no se escriben debido a la falta de tiempo de ingeniería.
La tragedia de la ingeniería de software hoy en día es que estamos construyendo activamente sistemas donde ni el usuario ni el constructor verifican si hay alguien detrás de la puerta. Simplemente nos encogemos de hombros y concluimos: esto estúpido es horrible.
| Etapa | Actividad |
|---|---|
| Configuración | Obtener cuenta FTP, montar con curlftpfs |
| Flujo de trabajo antiguo | Usar SVN o CVS en el sistema de archivos montado |
| Nuevo flujo de trabajo | Entregar preguntas opacas a Jev, obtener respuestas opacas |
| Pruebas | Construir evaluaciones y una canalización de verdad fundamental () |
La preocupación final del escritor es que la industria está normalizando fallas inexplicables. Jev es rápido y barato, pero nadie está verificando si funciona. Los puntajes de confianza no son una solución. El punto final de cada investigación no es la causa raíz; es un encogimiento de hombros.
Material fuente: “La Normalización de Inexplicables Fallas,” ihatethefuture.com.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

