¡AI News!: ya llega GPT-4 multimodal (Microsoft confirmó que el nuevo modelo de lenguaje se conocerá la próxima semana)

(Por Dino Dal Molin, Ceo de Bizit Global, en cocreación con Marcelo Maurizio) La próxima semana conoceremos GPT-4, la próxima generación del popular modelo de lenguaje de inteligencia artificial. Desde Microsoft adelantan que será multimodal.

Sabíamos que GPT-4 sería presentado, con mucha probabilidad, durante el primer semestre de 2023. Afortunadamente, OpenAI no decepcionará en este sentido. Microsoft, uno de los principales inversores de la startup especializada en inteligencia artificial, ha confirmado que el mundo conocerá el nuevo modelo de lenguaje la próxima semana.

De momento, eso sí, no revelaron el día específico.

Si bien gran parte de las novedades técnicas se las guardarán hasta el anuncio oficial, los de Redmond ya han adelantado un detalle clave: GPT-4 será multimodal.

OpenAI, la empresa detrás de Chat GPT y de potenciar el nuevo BING de Microsoft, ha dado a conocer finalmente la nueva versión de su modelo de lenguaje que utiliza Inteligencia Artificial, se trata de una nueva generación del modelo presente en el buscador de Microsoft, que acepta entradas tanto de texto, al igual que con la versión GPT-3, pero que ahora también soporta imágenes aunque las respuestas se mantienen únicamente de forma escrita.

Con GPT-4, por lo tanto, sería posible generar texto, imágenes, vídeos e incluso música. Andreas Braun, director de tecnología de Microsoft Alemania, se pronunció al respecto: 

A pesar de que OpenAI clasifica a GPT-4 como "menos capaz que los humanos en muchos escenarios del mundo real, cuenta con un rendimiento a nivel humano en varios entornos académicos y profesionales".

La compañía detalla que esta nueva versión de la IA es más confiable, creativa, y puede manejar instrucciones mucho más matizadas que su modelo más reciente, el GPT-3.5. Además, GPT-4 supera "considerablemente" a los modelos de lenguaje existentes y a la mayoría de los modelos de última generación.

¿Que quiere decir que un modelo de lenguaje sea multimodal? 

Básicamente, que puede interpretar tanto texto como imágenes. La versión anterior, que da vida a ChatGPT, solo es capaz de producir textos.

Braun describió GPT-4 como un game changer para el sector de la inteligencia artificial, ya que el modelo de lenguaje dará otro paso para acercarse a la capacidad de interpretación humana. Evidentemente, para igualarla todavía le queda un largo trayecto.

Otro de los beneficios de GPT-4 como lenguaje multimodal es que podrá gestionar la entrada y salida de datos en diferentes idiomas. Trasladando esta posibilidad a ChatGPT, podrías realizar la petición en español, pero que el texto generado se encuentre en inglés. Evidentemente, esta novedad también sería de gran ayuda para las herramientas de traducción

Desde Microsoft reiteran que el impacto de ChatGPT en la vida diaria de tantas personas es similar al que provocó el iPhone hace más de una década. No obstante, la popularidad del chatbot no frenó sus aspiraciones de seguir mejorando el modelo de lenguaje que lo hace posible. Por ello la gran atención que le están dedicando a la presentación de GPT-4.

Asimismo, la compañía dirigida por Saya Nadella ha dejado claro que GPT-4 no llega para robarse los empleos de las personas. Por ejemplo, aquellos que trabajan en medios de comunicación escrito. El objetivo principal es simplificar o potenciar su trabajo, no quitárselos.

Uno de los aspectos más interesantes de GPT-4 es su capacidad para comprender tanto imágenes como texto. GPT-4 puede subtitular -e incluso interpretar- imágenes relativamente complejas.

Lamentablemente, la capacidad de comprensión de imágenes aún no está disponible para todos los usuarios. Por ahora está en la etapa final de prueba y será accesible a través de una lista de espera solamente para quienes estén suscriptos a ChatGPT Plus.

Por ahora estará disponible solo para quienes paguen la suscripción al servicio premium de la herramienta. Se accede a través de una lista de espera.

Tu opinión enriquece este artículo:

"La realidad no se discute, se mide": análisis del discurso de Milei que reescribió las reglas del Mercosur (y de la política en Latam)

(Exclusivo InfoNegocios Miami | Análisis Textual y Geoestratégico, equipo: Maurizio-Molina-Mauvecin-Maqueda-Taylor-Rotmistrovsky) Javier Milei, con la precisión forense de quien no teme a los cadáveres institucionales, pronunció un discurso que será estudiado como caso de manual de comunicación política disruptiva. Lo que sigue es análisis puro del texto, sin adornos, donde cada frase de Milei se examina como si fuera un espécimen bajo el microscopio geoestratégico.

Dubai 2026: el campo de desarrollo del talento latino que redefinirá tu carrera (¿te gustaría trabajar en EAU?)

(Por M.G. Maurizio, Máximo Maurizio, con la colaboración de M. Mauvecin desde Dubai) Mientras Europa cierra puertas, y está abatida por una invasión migratoria que nada tiene que ver con lo “natural, lo económico o lo social” y Estados Unidos se encuentra en una revisión total de visas, Dubai ha ejecutado la jugada maestra: crear el ecosistema perfecto para el talento joven global. Y los latinos, sin saberlo, tenemos todas las cartas ganadoras.

(Tiempo de lectura de valor: 4 minutos)

Miami 2025: el Backchannel que podría cambiar el mapa geopolítico mundial (Putin envió a su representante)

(Exclusivo Infonegocios Miami | Análisis Textual y Geoestratégico, equipo: Maurizio-Molina-Mauvecin-Maqueda-Taylor-Rotmistrovsky) Mientras el mundo se distrae con las fiestas de fin de año, en una suite con vista al Biscayne Bay se está reescribiendo el orden mundial. No es metáfora. Es geopolítica pura: Kiril Dimitriev, el hombre de confianza de Vladimir Putin, está en Miami. (Otra muestra más de que la política o los políticos o las instituciones políticas históricas están literalmente caducas).

(Tiempo de lectura de valor: 4 minutos)