IA y modelos
Por qué los modelos de IA de Google fallan en tareas simples a nivel de palabras
Los AI Overviews de Google tienen dificultades con tareas básicas de ortografía y conteo, una limitación derivada de la arquitectura basada en tokens de los modelos de lenguaje extensos.
Los AI Overviews de Google enfrentan escrutinio público por fallar en tareas simples, como contar letras en palabras o deletrear términos comunes correctamente. Estos errores resaltan la dificultad persistente que tienen los modelos de lenguaje extensos (LLM)—sistemas de inteligencia artificial que impulsan chatbots y generadores de texto—con la precisión a nivel de caracteres. Por ejemplo, la IA afirmó que hay dos P en la palabra “Google” y exactamente una “r” en la palabra “poop”. También afirmó que hay dos d en la palabra “journalism” mientras la deletreaba “j-o-u-r-n-a-d-i-s-m”. Aunque la IA identificó correctamente que hay una P en el apellido del presidente de EE. UU., deletreó el nombre como “t-r-p-u-m”. Estos errores ocurren mientras Google integra IA generativa en su producto insignia de 29 años. La empresa ha tenido que abordar otros errores del sistema anteriormente; la semana pasada, Google corrigió un problema relacionado con la palabra “disregard”, que había devuelto una respuesta de prompt predeterminada en lugar de una definición. En un comunicado enviado por correo electrónico, Google reconoció los problemas de ortografía, afirmando que contar dentro de las palabras es un desafío conocido para los LLM y que están trabajando para solucionar este problema en particular.
La raíz del problema radica en cómo estos modelos procesan la información. En lugar de leer texto como un humano, los LLM dependen de un transformer—la arquitectura que impulsa a los LLM al dividir el texto en tokens, que son representaciones numéricas del texto utilizadas por los modelos de IA. Debido a este diseño, la IA no percibe las oraciones como unidades de lenguaje compuestas por palabras y letras individuales. “Los LLM se basan en esta arquitectura transformer, que notablemente no está leyendo texto en realidad. Lo que sucede cuando ingresas un prompt es que se traduce en una codificación”, dijo Matthew Guzdial, investigador de IA y profesor asistente en la Universidad de Alberta. Guzdial señaló que cuando el modelo procesa una palabra como “the”, reconoce la codificación única para toda la palabra, pero no conoce intrínsecamente las letras individuales “T”, “H” y “E”.
Estos errores son difíciles de resolver debido a la forma fundamental en que se procesa el texto. Sheridan Feucht, estudiante de doctorado que estudia la interpretabilidad de los modelos de lenguaje extensos en la Northeastern University, compartió que su suposición sería que no existe tal cosa como un tokenizador perfecto—el sistema que convierte texto en tokens—debido a la ambigüedad inherente de definir qué debería ser una palabra para un modelo de lenguaje. Feucht indicó que incluso si los expertos humanos acordaran un vocabulario de tokens perfecto, los modelos de IA probablemente aún encontrarían útil fragmentar las cosas aún más. En consecuencia, las tareas precisas de ortografía y conteo siguen siendo un desafío estructural para la arquitectura actual de la IA generativa.
Por qué importa
Los AI Overviews de Google tienen dificultades con tareas básicas de ortografía y conteo debido a la arquitectura basada en tokens de los LLM, lo que destaca las limitaciones de los modelos actuales de IA generativa.