Definición y concepto

Los modelos fundacionales, también denominados modelos de base, constituyen una categoría específica dentro de la inteligencia artificial caracterizada por su arquitectura y metodología de entrenamiento. Según la definición establecida por el Centro de Investigación de Modelos Fundacionales (CRFM) del Instituto para la Inteligencia Artificial Centrada en el Humano de la Universidad de Stanford (HAI), estos sistemas son modelos de inteligencia artificial entrenados con una gran cantidad de datos de diferentes dominios no etiquetados. Este proceso de entrenamiento extenso da como resultado un modelo que se puede adaptar a una amplia gama de tareas posteriores, lo que permite su flexibilidad y versatilidad en aplicaciones diversas.

Características técnicas y ejemplos representativos

La introducción de los modelos fundacionales en 2018 transformó el desarrollo de los sistemas de IA. Los primeros ejemplos de esta categoría fueron grandes modelos de lenguaje pre-entrenados, tales como BERT y GPT-3. Estos modelos establecieron el precedente de utilizar datos masivos y no etiquetados para capturar patrones generales que luego podían ser refinados para tareas específicas. Usando las mismas ideas fundamentales, se han construido modelos específicos de dominio que usan secuencias de otros tipos de tokens, como códigos médicos, demostrando la capacidad de estos sistemas para extenderse más allá del lenguaje natural estándar.

Posteriormente, se han producido modelos fundacionales multimodales, incluidos DALL-E, Flamingo y Florence. Estos avances permiten que los modelos procesen y generen información a través de múltiples formatos, como texto, imagen y audio, integrando así diversas fuentes de datos en una única arquitectura cohesiva. Esta evolución técnica refleja la capacidad de los modelos fundacionales para escalar en complejidad y alcance, manteniendo su esencia como sistemas adaptables entrenados en datos multidominio.

El término 'fundacional' frente a 'fundamental'

El término 'modelo fundacional' fue popularizado por el CRFM de Stanford en agosto de 2021. La elección de la palabra 'fundacional' en lugar de 'fundamental' busca destacar el papel de estos modelos como bases sobre las cuales se construyen otras capas de inteligencia artificial. Mientras que 'fundamental' podría sugerir una importancia inherente o primaria, 'fundacional' enfatiza la función estructural de estos modelos como cimientos que soportan y habilitan una amplia variedad de aplicaciones específicas. Esta distinción lingüística refleja la visión del CRFM sobre el rol central de estos sistemas en la arquitectura moderna de la IA, donde sirven como plataformas base que pueden ser adaptadas y especializadas para diferentes dominios y tareas.

Historia y evolución

Los modelos fundacionales, también conocidos como modelos de base, representan un punto de inflexión en el desarrollo de los sistemas de inteligencia artificial. Su introducción en 2018 marcó el inicio de una nueva etapa en el campo, transformando la forma en que se entrenan y aplican los modelos de IA. Estos modelos se caracterizan por ser entrenados con una gran cantidad de datos de diferentes dominios no etiquetados, lo que permite que se adapten a una amplia gama de tareas posteriores a su entrenamiento inicial.

Primeros ejemplos y modelos de lenguaje

Los primeros ejemplos de modelos fundacionales fueron grandes modelos de lenguaje pre-entrenados. Entre ellos destacan BERT y GPT-3, que sentaron las bases para el uso de secuencias de tokens en diferentes contextos. Estos modelos demostraron la capacidad de capturar patrones complejos en los datos de entrada, lo que permitió su aplicación en diversas tareas de procesamiento del lenguaje natural.

Evolución hacia modelos de dominio específico

Con el tiempo, las ideas detrás de los modelos fundacionales se extendieron a la creación de modelos específicos de dominio. Estos modelos utilizan secuencias de otros tipos de tokens, como códigos médicos, para adaptarse a necesidades particulares en áreas especializadas. Esta evolución ha permitido mejorar la precisión y la relevancia de los modelos en campos como la medicina, donde la interpretación de datos específicos es crucial.

Modelos fundacionales multimodales

Posteriormente, se han desarrollado modelos fundacionales multimodales que integran diferentes tipos de datos, como texto, imágenes y audio. Ejemplos destacados incluyen DALL-E, Flamingo y Florence. Estos modelos han ampliado las capacidades de la inteligencia artificial al permitir la interacción y la interpretación de múltiples modalidades de datos simultáneamente, abriendo nuevas posibilidades en la generación y el análisis de información.

El Centro de Investigación de Modelos Fundacionales (CRFM) del Institute for Human-Centered Artificial Intelligence de la Universidad de Stanford (HAI) ha jugado un papel clave en la popularización del término "modelo fundacional". Su trabajo ha contribuido a definir y estructurar el concepto, facilitando su adopción en la comunidad académica y en la industria.

¿Qué es el Centro de Investigación de Modelos Fundacionales?

El Centro de Investigación de Modelos Fundacionales (CRFM) es una entidad académica clave dentro del ecosistema de la inteligencia artificial moderna, operando bajo el paraguas del Instituto de Inteligencia Artificial Centrada en el Ser Humano (HAI) de la Universidad de Stanford. Su contribución más significativa al campo no fue necesariamente la invención técnica de los primeros modelos, sino la conceptualización y la estandarización del lenguaje utilizado para describirlos. Fue este centro el responsable de popularizar el término «modelo fundacional» en agosto de 2021, proporcionando un marco teórico unificado que permitió a investigadores, ingenieros y reguladores discutir estas tecnologías con mayor precisión. Antes de la intervención del CRFM, los sistemas como BERT o GPT-3 eran a menudo descritos mediante etiquetas técnicas dispersas o simplemente como «grandes modelos de lenguaje». El trabajo del CRFM consistió en sintetizar estas observaciones en una definición coherente: modelos entrenados en grandes cantidades de datos no etiquetados de múltiples dominios, capaces de adaptarse a una amplia gama de tareas posteriores. Esta definición fue crucial porque trascendió el ámbito puramente lingüístico, abarcando también los modelos multimodales emergentes como DALL-E y Flamingo. La ubicación del CRFM dentro del HAI de Stanford es estratégica, ya que el instituto se enfoca en cómo la IA afecta a la sociedad humana. Esta perspectiva influyó en cómo el CRFM presentó los modelos fundacionales, destacando no solo su potencia computacional, sino también su versatilidad y su impacto en diferentes dominios, incluyendo incluso secuencias de tokens específicos como los códigos médicos. Al establecer esta definición en 2021, el CRFM sentó las bases para los marcos regulatorios actuales en Estados Unidos, la Unión Europea y el Reino Unido, que han adoptado esta terminología para legislar sobre la transparencia y el rendimiento de estos sistemas. El impacto del CRFM se extiende más allá de la academia. Al proporcionar un término estandarizado, facilitó la comunicación entre la industria tecnológica y los legisladores. Esto fue esencial para el desarrollo de definiciones legales precisas que distinguen a los modelos fundacionales de otros tipos de algoritmos de IA. Sin la clarificación proporcionada por el CRFM, la regulación podría haber sido más fragmentada, dependiendo de definiciones técnicas menos accesibles. Por lo tanto, el papel del CRFM fue fundamental en la transición de los modelos fundacionales de ser una novedad técnica de 2018 a convertirse en un pilar estructural de la inteligencia artificial contemporánea, con implicaciones que van desde el desarrollo de software hasta la política pública global.

¿Cómo regulan los modelos fundacionales los gobiernos?

Regulación Definición legal de modelo fundacional Criterios clave
Estados Unidos (Orden Ejecutiva) Modelo de IA entrenado a gran escala que exhibe capacidades generales y puede adaptarse a una amplia gama de tareas distintas a aquellas para las que fue entrenado. Enfoque en la capacidad de generalización y adaptación a múltiples dominios sin entrenamiento específico adicional.
Unión Europea (Reglamento sobre IA) Modelo de IA desarrollado con métodos de aprendizaje, incluyendo el aprendizaje por representación, que se espera exhiba capacidades generales significativas. Énfasis en los métodos de aprendizaje (como el aprendizaje por representación) y la expectativa de capacidades generales significativas, independientemente del tamaño exacto de los parámetros o datos.
Reino Unido (AI Foundation Models: Initial Report) Modelos de IA entrenados en grandes conjuntos de datos que muestran un comportamiento emergente y capacidad de generalización a través de múltiples tareas. Destaca el entrenamiento en grandes volúmenes de datos y la aparición de comportamientos emergentes que permiten la generalización transversal a diversas tareas.

Las definiciones legales de los modelos fundacionales varían según la jurisdicción, reflejando diferentes enfoques regulatorios sobre cómo identificar y regular estos sistemas de inteligencia artificial. En Estados Unidos, la Orden Ejecutiva se centra en la capacidad funcional del modelo, definiéndolo por su habilidad para adaptarse a múltiples tareas distintas a las originales, sin especificar métricas cuantitativas precisas como el número de parámetros o el tamaño del conjunto de datos.

En la Unión Europea, el Reglamento sobre IA adopta un enfoque basado en los métodos de desarrollo, mencionando explícitamente el aprendizaje por representación como característica definitoria. Esta definición busca capturar la esencia técnica de cómo se construyen estos modelos, priorizando la expectativa de capacidades generales significativas sobre medidas puramente cuantitativas.

El Reino Unido, a través de su informe inicial sobre modelos fundacionales, combina elementos tanto del tamaño de los datos como de las capacidades emergentes. Esta definición reconoce que el entrenamiento a gran escala es un factor crítico, pero también destaca la importancia de los comportamientos emergentes que permiten la generalización a través de múltiples dominios.

Estas diferencias reflejan los distintos enfoques regulatorios: mientras que EE. UU. se enfoca en la funcionalidad y adaptabilidad, la UE prioriza los métodos técnicos de desarrollo, y el Reino Unido integra tanto el volumen de datos como las capacidades emergentes. Ninguna de estas definiciones establece umbrales numéricos universales para parámetros o datos, lo que permite cierta flexibilidad a medida que la tecnología evoluciona.

Características técnicas

Los modelos fundacionales se definen técnicamente por su capacidad de ser entrenados con una gran cantidad de datos de diferentes dominios no etiquetados. Esta característica distintiva permite que el resultado sea un modelo que se puede adaptar a una amplia gama de tareas, sin necesidad de un entrenamiento específico inicial para cada una de ellas. El aprendizaje autosupervisado es un componente esencial en este proceso, ya que permite a los modelos extraer patrones complejos de los datos sin depender exclusivamente de etiquetas manuales. Esta metodología ha transformado el desarrollo de los sistemas de inteligencia artificial desde su introducción en 2018, estableciendo un nuevo estándar en la flexibilidad y la eficiencia del entrenamiento.

Capacidad de adaptación y afinamiento

Una de las características más significativas de estos modelos es su capacidad de adaptación. Una vez que el modelo base ha sido entrenado con datos masivos, puede ser afinado para desempeñar tareas específicas con una relativa eficiencia. Este proceso de afinamiento permite que un solo modelo fundacional sirva como punto de partida para diversas aplicaciones, reduciendo la necesidad de construir modelos desde cero para cada nuevo desafío. Los primeros ejemplos de modelos fundacionales fueron grandes modelos de lenguaje pre-entrenados tales como BERT y GPT-3, que demostraron esta capacidad de adaptación en el procesamiento del lenguaje natural.

Expansión a dominios y modalidades específicas

Las ideas subyacentes a los modelos fundacionales han permitido la construcción de modelos específicos de dominio que usan secuencias de otros tipos de tokens. Por ejemplo, en el ámbito de la salud, se han desarrollado modelos que utilizan códigos médicos como tokens, permitiendo una comprensión más profunda de los datos clínicos. Además, la evolución de estos modelos ha llevado a la creación de modelos fundacionales multimodales. Ejemplos notables incluyen DALL-E, Flamingo y Florence, que integran múltiples tipos de datos, como imágenes y texto, en un solo marco de trabajo. Esta capacidad multimodal amplía aún más el alcance de los modelos fundacionales, permitiendo su aplicación en una variedad de campos que van más allá del lenguaje natural.

Tipos de modelos fundacionales

Los modelos fundacionales se clasifican según la naturaleza de los datos de entrenamiento y la diversidad de tareas para las cuales pueden ser adaptados. Las fuentes disponibles identifican tres categorías principales que ilustran la evolución y la versatilidad de esta arquitectura en la inteligencia artificial.

Grandes modelos de lenguaje

Esta categoría comprende los primeros ejemplos de modelos fundacionales, caracterizados por ser grandes modelos de lenguaje pre-entrenados. Estos sistemas procesan secuencias de texto para capturar relaciones semánticas y sintácticas complejas. BERT y GPT-3 son citados como ejemplos representativos de esta clase. Estos modelos establecieron las bases para el desarrollo posterior de sistemas de IA al demostrar la capacidad de adaptación a múltiples tareas lingüísticas mediante el entrenamiento con grandes volúmenes de datos no etiquetados.

Modelos de dominio específico

Aplicando las mismas ideas fundamentales de los modelos de lenguaje generales, se han construido modelos diseñados para dominios especializados. Estos sistemas utilizan secuencias de otros tipos de tokens adaptados a necesidades concretas. Un ejemplo mencionado es el uso de códigos médicos, donde la estructura de los datos difiere del lenguaje natural estándar pero sigue principios similares de secuencialidad y predicción. Esta adaptación permite a los modelos capturar matices técnicos específicos de un campo, mejorando el rendimiento en tareas especializadas en comparación con los modelos generales.

Modelos fundacionales multimodales

Una evolución posterior en la arquitectura de estos modelos es la incorporación de la multimodalidad. Los modelos fundacionales multimodales son capaces de procesar y relacionar diferentes tipos de datos, superando la limitación de un solo tipo de entrada. DALL-E, Flamingo y Florence son ejemplos destacados de esta categoría. Estos sistemas integran información de diversas fuentes, permitiendo una comprensión más rica y contextualizada de los datos de entrada, lo que amplía significativamente el rango de aplicaciones posibles en el desarrollo de sistemas de inteligencia artificial.

Impacto en el desarrollo de sistemas de IA

Los modelos fundacionales han transformado el desarrollo de los sistemas de inteligencia artificial desde su introducción en 2018. Este cambio de paradigma ha establecido a estos modelos como el 'cimiento' esencial sobre el cual se construyen y adaptan los sistemas de IA modernos para una amplia gama de tareas específicas. La capacidad de entrenar con grandes volúmenes de datos de diferentes dominios no etiquetados permite una flexibilidad que los enfoques anteriores no poseían en la misma medida.

De modelos de lenguaje a aplicaciones de dominio específico

Estos sistemas demostraron que el aprendizaje de representaciones generales a partir de datos no etiquetados podía servir como base para el ajuste fino en tareas concretas. Usando las mismas ideas subyacentes, la investigación y la industria han avanzado hacia la construcción de modelos específicos de dominio. Estos modelos especializados utilizan secuencias de otros tipos de tokens, como códigos médicos, permitiendo una aplicación más precisa en campos técnicos y profesionales donde la generalidad debe complementarse con la precisión contextual.

La era de la multimodalidad

Posteriormente, se han producido modelos fundacionales multimodales, que expanden el alcance más allá del texto puro. Estos sistemas integran múltiples tipos de datos de entrada y salida, lo que representa una evolución significativa en la arquitectura y la utilidad práctica de los modelos de base. La capacidad de procesar y relacionar diferentes modalidades de datos ha ampliado las posibilidades de aplicación de la inteligencia artificial en áreas que requieren una comprensión integrada de la información visual, textual y de otros formatos.

Definición y marco conceptual

Esta definición académica ha sido crucial para estandarizar el lenguaje utilizado en la investigación y la aplicación práctica. La conceptualización proporcionada por Stanford ha ayudado a distinguir estos modelos de otras arquitecturas de IA, enfatizando su naturaleza de entrenamiento a gran escala y su capacidad de adaptación a múltiples tareas. Este marco conceptual ha facilitado la discusión técnica y la comparación de diferentes enfoques dentro de la comunidad de inteligencia artificial.

Véase también

Referencias

  1. «Modelos fundacionales» en Wikipedia en español
  2. Foundational Models of AI — Stanford HAI
  3. Foundational Models — IEEE Standards Association
  4. Foundational Models — ACM Digital Library
  5. Foundational Models — MIT Technology Review