¡AI News!: ya llega GPT-4 multimodal (Microsoft confirmó que el nuevo modelo de lenguaje se conocerá la próxima semana)

(Por Dino Dal Molin, Ceo de Bizit Global, en cocreación con Marcelo Maurizio) La próxima semana conoceremos GPT-4, la próxima generación del popular modelo de lenguaje de inteligencia artificial. Desde Microsoft adelantan que será multimodal.

Sabíamos que GPT-4 sería presentado, con mucha probabilidad, durante el primer semestre de 2023. Afortunadamente, OpenAI no decepcionará en este sentido. Microsoft, uno de los principales inversores de la startup especializada en inteligencia artificial, ha confirmado que el mundo conocerá el nuevo modelo de lenguaje la próxima semana.

De momento, eso sí, no revelaron el día específico.

Si bien gran parte de las novedades técnicas se las guardarán hasta el anuncio oficial, los de Redmond ya han adelantado un detalle clave: GPT-4 será multimodal.

OpenAI, la empresa detrás de Chat GPT y de potenciar el nuevo BING de Microsoft, ha dado a conocer finalmente la nueva versión de su modelo de lenguaje que utiliza Inteligencia Artificial, se trata de una nueva generación del modelo presente en el buscador de Microsoft, que acepta entradas tanto de texto, al igual que con la versión GPT-3, pero que ahora también soporta imágenes aunque las respuestas se mantienen únicamente de forma escrita.

Con GPT-4, por lo tanto, sería posible generar texto, imágenes, vídeos e incluso música. Andreas Braun, director de tecnología de Microsoft Alemania, se pronunció al respecto: 

A pesar de que OpenAI clasifica a GPT-4 como "menos capaz que los humanos en muchos escenarios del mundo real, cuenta con un rendimiento a nivel humano en varios entornos académicos y profesionales".

La compañía detalla que esta nueva versión de la IA es más confiable, creativa, y puede manejar instrucciones mucho más matizadas que su modelo más reciente, el GPT-3.5. Además, GPT-4 supera "considerablemente" a los modelos de lenguaje existentes y a la mayoría de los modelos de última generación.

¿Que quiere decir que un modelo de lenguaje sea multimodal? 

Básicamente, que puede interpretar tanto texto como imágenes. La versión anterior, que da vida a ChatGPT, solo es capaz de producir textos.

Braun describió GPT-4 como un game changer para el sector de la inteligencia artificial, ya que el modelo de lenguaje dará otro paso para acercarse a la capacidad de interpretación humana. Evidentemente, para igualarla todavía le queda un largo trayecto.

Otro de los beneficios de GPT-4 como lenguaje multimodal es que podrá gestionar la entrada y salida de datos en diferentes idiomas. Trasladando esta posibilidad a ChatGPT, podrías realizar la petición en español, pero que el texto generado se encuentre en inglés. Evidentemente, esta novedad también sería de gran ayuda para las herramientas de traducción

Desde Microsoft reiteran que el impacto de ChatGPT en la vida diaria de tantas personas es similar al que provocó el iPhone hace más de una década. No obstante, la popularidad del chatbot no frenó sus aspiraciones de seguir mejorando el modelo de lenguaje que lo hace posible. Por ello la gran atención que le están dedicando a la presentación de GPT-4.

Asimismo, la compañía dirigida por Saya Nadella ha dejado claro que GPT-4 no llega para robarse los empleos de las personas. Por ejemplo, aquellos que trabajan en medios de comunicación escrito. El objetivo principal es simplificar o potenciar su trabajo, no quitárselos.

Uno de los aspectos más interesantes de GPT-4 es su capacidad para comprender tanto imágenes como texto. GPT-4 puede subtitular -e incluso interpretar- imágenes relativamente complejas.

Lamentablemente, la capacidad de comprensión de imágenes aún no está disponible para todos los usuarios. Por ahora está en la etapa final de prueba y será accesible a través de una lista de espera solamente para quienes estén suscriptos a ChatGPT Plus.

Por ahora estará disponible solo para quienes paguen la suscripción al servicio premium de la herramienta. Se accede a través de una lista de espera.

Lo que Harvard, Cambridge y el MIT confirman: neurociencia del liderazgo lector (en la era digital, leer es lo más inteligente)

(Por Maurizio y Rotmistrovsky) " Según Cal Newport en "Deep Work" — citado por el 79% de los graduados de Oxford en negocios — la lectura sostenida incrementa la mielinización neuronal: el proceso por el cual el cerebro refuerza las conexiones entre neuronas frecuentemente activadas, aumentando la velocidad y eficiencia del procesamiento cognitivo.

El por qué del radical cambio de consumo y la transformación del mercado de bebidas (un análisis estratégico del sector)

(Por Rodriguez Otero y Maurizio) La decisión de Coca-Cola y otras marcas de lanzar productos como Triple Z se debe a un profundo cambio en la dinámica del consumo. El ascenso de las aguas funcionales, bebidas nutricionales, gaseosas de probióticos, cervezas saludables y jugos enriquecidos-proteicos demuestran que las preferencias de los consumidores están evolucionando.

2026: los 7 pecados mortales que las empresas deben dejar de cometer

(Por Rotmistrovsky-Otero-Maurizio) En la actual era de transformación empresarial, lo que alguna vez fue un camino hacia el éxito durante 20 años puede haberse vuelto obsoleto. Las organizaciones ya no pueden depender de un liderazgo centrado en el "ego" y en los viejos “dogmas gerenciales”.