Google cuenta con los suyos GPT-4 competidor, Geminis, tanto que montó partes de un vídeo de demostración reciente. En un artículo de opinión, Bloomberg dice Google admite que por su vídeo titulado «Práctica con Gemini: interacción con IA multimodal» no solo fue editado para acelerar las salidas (como se declaró en la descripción del video), sino que la interacción de voz implícita entre el usuario humano y la IA era en realidad inexistente.
En cambio, la demostración real se realizó «utilizando fotogramas de imágenes fijas del metraje y solicitando mensajes de texto», en lugar de que Gemini respondiera, o incluso predijera, un dibujo o cambio de objetos en la mesa en tiempo real. Esto es mucho menos impresionante de lo que el vídeo quiere hacernos creer y, peor aún, la falta de descargo de responsabilidad sobre el método de entrada real hace que Gemini’s preparación bastante cuestionable.
No sorprende que Google niegue haber actuado mal en este caso, tal como lo refirió. El borde a una publicación de X escrita por el codirector de Gemini, Oriol Vinyals, que dice que «todas las indicaciones y resultados del usuario en el video son reales» y que su equipo hizo el video «para inspirar a los desarrolladores». Dada la atención que la industria y las autoridades han prestado últimamente a la IA, tal vez el gigante tecnológico debería ser más sensible a sus presentaciones en este campo.
Realmente feliz de ver el interés en torno a nuestro video “Práctica con Géminis”. En nuestro blog de desarrolladores de ayer, desglosamos cómo se utilizó Gemini para crearlo. https://t.co/50gjMkaVc0
Le dimos a Géminis secuencias de diferentes modalidades (imagen y texto en este caso) y le hicimos responder… pic.twitter.com/Beba5M5dHP
— Oriol Vinyals (@OriolVinyalsML) 7 de diciembre de 2023