Mi tarea para nuestros señores de la IA era simple: ayudarme a descifrar el New York Times Concurso de ortografía.
Había pasado gran parte del sábado por la noche tratando de formar tantas palabras como fuera posible con las letras G, Y, A, L, P, O y N. Pero tres horas, 141 puntos y 37 palabras (incluyendo “no disculpa”, “laguna” y “analogía”) después, me había topado con una pared. Unas pocas palabras más fue todo lo que necesité para impulsarme al escalón de «genio» del Spelling Bee, el título reservado para aquellos que descifran el 70 por ciento de todas las palabras posibles usando las letras dadas, y el punto en el que el rompecabezas se considera, efectivamente, resuelto. . (A los solucionadores al 100 por ciento se les otorga el rango de «abeja reina», pero incluso yo tengo límites).
Mi mente humana claramente estaba luchando, pero esta tarea parecía un juego de niños para la IA, así que encendí ChatGPT, le dije que estaba tratando de ganar el concurso de ortografía, le di mis cartas y le expliqué las reglas. “Dame una lista de cada palabra que se puede formar con ellas”, escribí. «Puedes repetir letras, pero cada palabra debe contener ‘N'».
Cuando presioné Enter, esto es lo que ChatGPT escupió:
Aquí tienes una lista de palabras formadas con las letras «GYALPON» que deben contener la letra «N»:
GLNPAYO
YPNL
PGNOYL
ONAPYLG
LGNAPYO
ANLY
NAYGOPL
GYPON
AOGPLNY
PNAOGLIA
Esta es sólo una muestra de la lista debido a la gran cantidad de permutaciones posibles.
No es un gran comienzo.
«Las palabras deben estar en el diccionario», respondí. “Claro”, fue la respuesta. “Proporcionaré una lista de palabras en inglés válidas basadas en las letras dadas.” ANGLY, GALON, LANG.
Claramente, esto no estaba funcionando, así que recurrí al Copilot de Microsoft (YANG, JUGANDO, PLANIFICANDO, MOLESTO), Géminis de Google (GAPON, GONZÁLEZ, GIAN), y Claude de Anthropic (MANGO, EN CURSO, CÉSPED17.LAY). Meta AI me dijo amablemente que se aseguró de incluir solo palabras reconocidas por los diccionarios en una lista que contenía NALYP y NAGY, mientras que Perplexity, un chatbot con ambiciones de acabar con la Búsqueda de Google – simplemente escribió GALÓN cientos de veces antes de congelarse abruptamente.


La IA ahora puede crear imágenes, videos y audio tan rápido como puedes escribir descripciones de lo que deseas. Puede escribir poesía, ensayos y trabajos finales. También puede ser una pálida imitación de tu novia, tu terapeuta y tu asistente personal. Y mucha gente piensa que está a punto de eliminar a los humanos de sus empleos y transformar el mundo en formas que apenas podemos empezar a imaginar. Entonces, ¿por qué cuesta tanto resolver un simple acertijo de palabras?
La respuesta está en cómo funcionan los grandes modelos de lenguaje, la tecnología subyacente que impulsa nuestra moda moderna de IA. La programación informática es tradicionalmente lógica y basada en reglas; usted escribe comandos que una computadora sigue de acuerdo con un conjunto de instrucciones y proporciona un resultado válido. Pero el aprendizaje automático, del cual la IA generativa es un subconjunto, es diferente.
«Es puramente estadístico», me dijo Noah Giansiracusa, profesor de matemáticas y ciencia de datos en la Universidad de Bentley. «En realidad se trata de extraer patrones de los datos y luego generar nuevos datos que se ajusten en gran medida a esos patrones».
OpenAI no respondió oficialmente, pero un portavoz de la compañía me dijo que este tipo de «retroalimentación» ayudó a OpenAI a mejorar la comprensión del modelo y las respuestas a los problemas. «Cosas como estructuras de palabras y anagramas no son un caso de uso común para Perplexity, por lo que nuestro modelo no está optimizado para ello», me dijo la portavoz de la empresa, Sara Platnick. «Como jugador diario de Wordle/Conexiones/Mini crucigramas, ¡estoy emocionado de ver cómo lo hacemos!» Microsoft y Meta declinaron hacer comentarios. Google y Anthropic no respondieron al momento de la publicación.
En el corazón de los grandes modelos de lenguaje se encuentran los “transformadores”, un avance técnico realizado por investigadores de Google en 2017. Una vez que se escribe una indicación, un modelo de lenguaje de gran tamaño descompone palabras o fracciones de esas palabras en unidades matemáticas llamadas “tokens”. Los transformadores son capaces de analizar cada token en el contexto del conjunto de datos más grande en el que se entrena un modelo para ver cómo están conectados entre sí. Una vez que un transformador comprende estas relaciones, puede responder a su mensaje adivinando el siguiente token probable en una secuencia. El Tiempos financieros tiene una estupenda explicador animado eso desglosa todo esto si estás interesado.


I pensamiento Estaba dando a los chatbots instrucciones precisas para generar mis palabras del concurso de ortografía, todo lo que hacían era convertir mis palabras en tokens y usar transformadores para escupir respuestas plausibles. «No es lo mismo que programar una computadora o escribir un comando en un indicador de DOS», dijo Giansiracusa. «Tus palabras se tradujeron a números y luego se procesaron estadísticamente». Parece que una consulta basada puramente en la lógica era exactamente la peor aplicación para las habilidades de la IA, similar a intentar girar un tornillo con un martillo que consume muchos recursos.
El éxito de un modelo de IA también depende de los datos con los que se entrena. Esta es la razón por la que las empresas de IA están cerrando febrilmente acuerdos con los editores de noticias en este momento: cuanto más actualizados sean los datos de capacitación, mejores serán las respuestas. La IA generativa, por ejemplo, apesta en sugerir movimientos de ajedrez, pero al menos es ligeramente mejor en la tarea que resolviendo crucigramas. Giansiracusa señala que es casi seguro que la gran cantidad de juegos de ajedrez disponibles en Internet se incluyen en los datos de entrenamiento para los modelos de IA existentes. «Sospecho que simplemente no hay suficientes juegos de Spelling Bee anotados en línea para que la IA pueda entrenar, como hay juegos de ajedrez», dijo.
«Si su chatbot parece más confundido por un juego de palabras que por un gato con un cubo de Rubik, es porque no fue especialmente entrenado para jugar juegos de palabras complejos», dijo Sandi Besen, investigadora de inteligencia artificial en Neudesic, una empresa de inteligencia artificial propiedad de IBM. «Los juegos de palabras tienen reglas y restricciones específicas que un modelo tendría dificultades para cumplir a menos que se le indique específicamente durante el entrenamiento, el ajuste o las indicaciones».
«Si tu chatbot parece más confundido por un juego de palabras que por un gato con un cubo de Rubik, es porque no fue especialmente entrenado para jugar juegos de palabras complejos».
Nada de esto ha impedido que las principales empresas de inteligencia artificial del mundo comercialicen la tecnología como una panacea, a menudo afirmaciones extremadamente exageradas sobre sus capacidades. En abril, tanto OpenAI como Meta se jactaron de que sus nuevos modelos de IA serían capaces de «razonar» y «planificar». En una entrevista, el director de operaciones de OpenAI, Brad Lightcap dijo el Tiempos financieros que la próxima generación de GPT, el modelo de IA que impulsa ChatGPT, mostraría avances en la resolución de “problemas difíciles” como el razonamiento. Joelle Pineau, vicepresidenta de investigación de IA de Meta, dijo a la publicación que la compañía estaba «trabajando arduamente para descubrir cómo hacer que estos modelos no sólo hablen, sino que razonen, planifiquen… tengan memoria».
Mis repetidos intentos de conseguir que GPT-4o y Llama 3 descifraran el concurso de ortografía fracasaron espectacularmente. Cuando le dije a ChatGPT que GALON, LANG y ANGLY no estaban en el diccionario, el chatbot dijo que estaba de acuerdo conmigo y sugirió GALVANOPÍA en cambio. Cuando escribí mal el mundo «seguro» como «sur» en mi respuesta a la oferta de Meta AI de encontrar más palabras, el chatbot me dijo que «sur» era, de hecho, otra palabra que se puede formar con las letras G, Y. , A, L, P, O y N.
Claramente, todavía estamos muy lejos de la Inteligencia General Artificial, el nebuloso concepto que describe el momento en que las máquinas son capaces de realizar la mayoría de las tareas tan bien o mejor que los seres humanos. Algunos expertos, como Yann LeCun, el científico jefe de IA de Meta, han sido francos sobre las limitaciones de los grandes modelos de lenguaje, afirmando que nunca alcanzarán la inteligencia a nivel humano ya que en realidad no utilizan la lógica. En un evento celebrado en Londres el año pasado, LeCun dicho que la generación actual de modelos de IA “simplemente no entiende cómo funciona el mundo. No son capaces de planificar. «No son capaces de razonar realmente», dijo. «No tenemos autos completamente autónomos que puedan entrenarse para conducir en aproximadamente 20 horas de práctica, algo que un joven de 17 años puede hacer».
Giansiracusa, sin embargo, adopta un tono más cauteloso. “Realmente no sabemos cómo razonan los humanos, ¿verdad? No sabemos qué es realmente la inteligencia. No sé si mi cerebro es simplemente una gran calculadora estadística, algo así como una versión más eficiente de un gran modelo de lenguaje”.
Quizás la clave para vivir con IA generativa sin sucumbir ni a la exageración ni a la ansiedad sea simplemente comprender sus limitaciones inherentes. «Estas herramientas en realidad no están diseñadas para muchas de las cosas para las que la gente las usa», dijo Chirag Shah, profesor de IA y aprendizaje automático en la Universidad de Washington. Coescribió un artículo de alto perfil trabajo de investigación en 2022 criticando el uso de grandes modelos de lenguaje en los motores de búsqueda. Las empresas tecnológicas, piensa Shah, podrían hacer un trabajo mucho mejor al ser transparentes sobre lo que la IA puede y no puede hacer antes de imponérnosla. Sin embargo, es posible que ese barco ya haya zarpado. En los últimos meses, las empresas tecnológicas más grandes del mundo – microsoft, Meta, Samsung, Manzanay Google – han hecho declaraciones para integrar estrechamente la IA en sus productos, servicios y sistemas operativos.
«Los bots apestan porque no fueron diseñados para esto», dijo Shah sobre mi enigma del juego de palabras. Queda por ver si apestan en todos los demás problemas que les plantean las empresas de tecnología.
¿De qué otra manera te han fallado los chatbots de IA? Envíeme un correo electrónico a [email protected] ¡y déjame saber!
Actualización, 13 de junio de 2024, 4:19 p.m. ET: Esta historia se ha actualizado para incluir una declaración de Perplexity.