¡AI News!: ya llega GPT-4 multimodal (Microsoft confirmó que el nuevo modelo de lenguaje se conocerá la próxima semana)

(Por Dino Dal Molin, Ceo de Bizit Global, en cocreación con Marcelo Maurizio) La próxima semana conoceremos GPT-4, la próxima generación del popular modelo de lenguaje de inteligencia artificial. Desde Microsoft adelantan que será multimodal.

Sabíamos que GPT-4 sería presentado, con mucha probabilidad, durante el primer semestre de 2023. Afortunadamente, OpenAI no decepcionará en este sentido. Microsoft, uno de los principales inversores de la startup especializada en inteligencia artificial, ha confirmado que el mundo conocerá el nuevo modelo de lenguaje la próxima semana.

De momento, eso sí, no revelaron el día específico.

Si bien gran parte de las novedades técnicas se las guardarán hasta el anuncio oficial, los de Redmond ya han adelantado un detalle clave: GPT-4 será multimodal.

OpenAI, la empresa detrás de Chat GPT y de potenciar el nuevo BING de Microsoft, ha dado a conocer finalmente la nueva versión de su modelo de lenguaje que utiliza Inteligencia Artificial, se trata de una nueva generación del modelo presente en el buscador de Microsoft, que acepta entradas tanto de texto, al igual que con la versión GPT-3, pero que ahora también soporta imágenes aunque las respuestas se mantienen únicamente de forma escrita.

Con GPT-4, por lo tanto, sería posible generar texto, imágenes, vídeos e incluso música. Andreas Braun, director de tecnología de Microsoft Alemania, se pronunció al respecto: 

A pesar de que OpenAI clasifica a GPT-4 como "menos capaz que los humanos en muchos escenarios del mundo real, cuenta con un rendimiento a nivel humano en varios entornos académicos y profesionales".

La compañía detalla que esta nueva versión de la IA es más confiable, creativa, y puede manejar instrucciones mucho más matizadas que su modelo más reciente, el GPT-3.5. Además, GPT-4 supera "considerablemente" a los modelos de lenguaje existentes y a la mayoría de los modelos de última generación.

¿Que quiere decir que un modelo de lenguaje sea multimodal? 

Básicamente, que puede interpretar tanto texto como imágenes. La versión anterior, que da vida a ChatGPT, solo es capaz de producir textos.

Braun describió GPT-4 como un game changer para el sector de la inteligencia artificial, ya que el modelo de lenguaje dará otro paso para acercarse a la capacidad de interpretación humana. Evidentemente, para igualarla todavía le queda un largo trayecto.

Otro de los beneficios de GPT-4 como lenguaje multimodal es que podrá gestionar la entrada y salida de datos en diferentes idiomas. Trasladando esta posibilidad a ChatGPT, podrías realizar la petición en español, pero que el texto generado se encuentre en inglés. Evidentemente, esta novedad también sería de gran ayuda para las herramientas de traducción

Desde Microsoft reiteran que el impacto de ChatGPT en la vida diaria de tantas personas es similar al que provocó el iPhone hace más de una década. No obstante, la popularidad del chatbot no frenó sus aspiraciones de seguir mejorando el modelo de lenguaje que lo hace posible. Por ello la gran atención que le están dedicando a la presentación de GPT-4.

Asimismo, la compañía dirigida por Saya Nadella ha dejado claro que GPT-4 no llega para robarse los empleos de las personas. Por ejemplo, aquellos que trabajan en medios de comunicación escrito. El objetivo principal es simplificar o potenciar su trabajo, no quitárselos.

Uno de los aspectos más interesantes de GPT-4 es su capacidad para comprender tanto imágenes como texto. GPT-4 puede subtitular -e incluso interpretar- imágenes relativamente complejas.

Lamentablemente, la capacidad de comprensión de imágenes aún no está disponible para todos los usuarios. Por ahora está en la etapa final de prueba y será accesible a través de una lista de espera solamente para quienes estén suscriptos a ChatGPT Plus.

Por ahora estará disponible solo para quienes paguen la suscripción al servicio premium de la herramienta. Se accede a través de una lista de espera.

Tu opinión enriquece este artículo:

F1 2026: el laboratorio estratégico que comienza en Australia, ¿Qué equipos llegan mejor?

(Por Maqueda, OneF1 y Maurizio) Este fin de semana, mientras el sol sale sobre Albert Park en Melbourne, algo mucho más profundo que una carrera de autos comienza en la Fórmula 1. El Gran Premio de Australia abre la temporada 2026 del campeonato mundial y, con él, se activa el sistema de innovación más sofisticado del deporte global.

(Lectura de valor, 4 minutos de lectura, material idea para compartir)

Edición especial Apple 50 años: el modelo que el mundo post-COVID está copiando (y por qué Apple lo inventó primero, y no es “tech”)

(Por Maurizio-Rodriguez Otero & Taylor) En 2026, las marcas más vibrantes del planeta están haciendo algo que tiene nombre técnico en la literatura de management actual: expansión de la categoría. No en una línea o en un avance “literal” hacia atrás, en una total redimensión de las formas de relación marca-consumidor. Te lo explicamos. (Y no, ni es imposible, ni es solo para algunas marcas, esto es para todos y hoy). 

(Lectura de alto valor estratégico, 4 minutos; ideal para compartir y guardar)

Miami Open 2026: donde el tenis, la cultura y la gastronomía se encuentran

(Por Vera desde el Hard Rock Stadium) Este torneo no es solo uno de los más prestigiosos del circuito ATP y WTA; es una experiencia cultural y gastronómica que atrae a las mejores estrellas del deporte, marcas de renombre y un público entusiasta.

(Lectura de alto valor estratégico, 4 minutos; ideal para compartir y guardar)

Edición especial Apple 50 años: el secreto que Steve Jobs nunca publicó y que el Post-COVID está obligando a reescribir a toda marca

(Por Maurizio-Rodriguez Otero & Taylor) Hoy, en un mundo donde la “expansión” de la experiencia es más importante que el producto o el servicio, donde la reinterpretación nos da esta brillante definición: "La innovación no es lo que dices que haces. Es lo que la gente siente cuando te usa." — Steve Jobs, 1997.

(Lectura de alto valor estratégico, 4 minutos; ideal para compartir y guardar)