Modelo de lenguaje
Modelo de lenguaje, abreviado como ML o LM por la expresión inglesa language model, es un modelo computacional que asigna probabilidades a unidades, secuencias o estructuras lingüísticas y utiliza esas probabilidades para predecir, analizar, representar o generar lenguaje. Un modelo de lenguaje puede estimar qué palabra, carácter, subpalabra o token resulta probable dentro de un contexto, evaluar la plausibilidad de una secuencia o producir nuevas continuaciones a partir de una entrada.
Los modelos de lenguaje constituyen una tecnología central del procesamiento del lenguaje natural y se utilizan en traducción automática, reconocimiento de voz, corrección ortográfica, búsqueda, clasificación, resumen, generación de contenidos, programación, chatbots, sistemas de recomendación, recuperación de información y agentes de inteligencia artificial.
En marketing digital, los modelos de lenguaje permiten analizar conversaciones, clasificar reseñas, generar borradores, resumir investigaciones, adaptar mensajes, automatizar atención, organizar bases de conocimiento, apoyar ventas, construir asistentes y transformar información no estructurada en datos utilizables. Su aplicación requiere revisar exactitud, sesgos, privacidad, seguridad, propiedad intelectual, coherencia de marca y correspondencia con las necesidades reales del usuario.
Introducción
El lenguaje humano contiene regularidades estadísticas. Algunas palabras aparecen con mayor frecuencia después de determinadas expresiones, ciertas estructuras gramaticales resultan más probables que otras y el significado de una unidad depende parcialmente de los elementos que la rodean.
Un modelo de lenguaje intenta representar computacionalmente estas regularidades. Ante una frase incompleta como «El cliente realizó una», el sistema puede asignar probabilidades diferentes a continuaciones como «compra», «consulta», «devolución» o «campaña». La selección depende del contexto, los datos de entrenamiento, la arquitectura y el objetivo utilizado durante el aprendizaje.
Los primeros modelos se apoyaron en conteos de palabras y secuencias observadas dentro de corpus. Los modelos contemporáneos utilizan redes neuronales con millones o miles de millones de parámetros y aprenden representaciones distribuidas del lenguaje a partir de grandes cantidades de texto, código y datos multimodales.
La función central permanece relacionada con la estimación de probabilidades. Un modelo autoregresivo calcula la probabilidad del siguiente token a partir de los tokens anteriores. Un modelo enmascarado intenta reconstruir unidades ocultas utilizando el contexto disponible a ambos lados. Un modelo secuencia a secuencia transforma una entrada en una salida, como ocurre en traducción, resumen o respuesta a preguntas.
Los modelos de lenguaje recientes pueden ejecutar múltiples tareas mediante prompts, ejemplos y herramientas. Esta flexibilidad ha llevado a que el público relacione el concepto principalmente con asistentes conversacionales, aunque el campo es más amplio y comprende modelos estadísticos, neuronales, especializados, multilingües, bidireccionales, generativos y multimodales.
Un modelo de lenguaje carece por sí mismo de una interfaz conversacional, personalidad, memoria permanente, acceso a internet o capacidad para ejecutar acciones. Estas funciones aparecen cuando el modelo se integra con instrucciones, aplicaciones, bases de datos, buscadores, herramientas, políticas y sistemas de memoria.
La fluidez de la salida tampoco garantiza que el contenido sea verdadero. El objetivo de entrenamiento suele recompensar la predicción de patrones lingüísticos, mientras la verificación factual exige fuentes, recuperación, herramientas y procedimientos adicionales.
Definición
Modelo de lenguaje puede definirse como un sistema matemático o computacional que estima una distribución de probabilidad sobre unidades lingüísticas o secuencias de lenguaje.
Para una secuencia formada por palabras o tokens, el modelo puede estimar la probabilidad conjunta de todos sus elementos mediante la probabilidad de cada unidad condicionada por el contexto anterior.
La idea puede representarse conceptualmente como:
<math>P(w_1,w_2,\ldots,w_n)=\prod_{i=1}^{n}P(w_i\mid w_1,\ldots,w_{i-1})</math>
En esta expresión, cada elemento se predice utilizando los elementos que lo preceden. Los modelos autoregresivos contemporáneos aplican una versión de este principio sobre tokens y representaciones neuronales.
Una definición operativa puede apoyarse en diez criterios:
- Representación del lenguaje: el sistema procesa palabras, caracteres, subpalabras, tokens u otras unidades.
- Modelado contextual: estima relaciones entre una unidad y los elementos que la rodean.
- Asignación de probabilidades: calcula la plausibilidad de diferentes secuencias o continuaciones.
- Aprendizaje a partir de datos: identifica patrones lingüísticos mediante corpus de entrenamiento.
- Predicción: puede anticipar unidades ocultas, siguientes o relacionadas.
- Generación: algunos modelos producen nuevas secuencias mediante muestreo o decodificación.
- Representación distribuida: los modelos neuronales codifican información en vectores y parámetros.
- Generalización: intenta responder a secuencias que no aparecieron exactamente durante el entrenamiento.
- Dependencia arquitectónica: su comportamiento varía según n-gramas, redes recurrentes, transformers u otros métodos.
- Evaluación probabilística: la calidad puede medirse mediante pérdida, entropía, perplejidad y desempeño en tareas.
El concepto comprende modelos de diferentes tamaños y finalidades. Un corrector predictivo instalado en un teléfono puede utilizar un modelo pequeño, mientras un asistente empresarial puede apoyarse en un modelo de lenguaje de gran tamaño conectado con herramientas y datos privados.
Terminología
Modelo de lenguaje. Denominación general para los sistemas que estiman relaciones probabilísticas dentro del lenguaje.
Language model. Expresión inglesa de la que procede la abreviatura LM.
Modelo lingüístico. Traducción utilizada en algunos textos, aunque también puede confundirse con modelos teóricos desarrollados dentro de la lingüística.
Modelo estadístico de lenguaje. Utiliza conteos, frecuencias y probabilidades explícitas.
Modelo neuronal de lenguaje. Utiliza redes neuronales para aprender representaciones y distribuciones.
Modelo de lenguaje preentrenado. Se entrena previamente sobre grandes corpus y se adapta posteriormente a tareas específicas.
Modelo de lenguaje de gran tamaño. Modelo neuronal de escala elevada que utiliza grandes cantidades de parámetros, datos y cómputo.
Modelo generativo de lenguaje. Produce secuencias mediante predicción y muestreo.
Modelo enmascarado de lenguaje. Aprende a reconstruir unidades ocultas dentro de una secuencia.
Modelo autoregresivo. Predice cada unidad utilizando las unidades anteriores.
Modelo bidireccional. Construye representaciones utilizando contexto situado a ambos lados de una unidad.
Modelo multimodal. Relaciona lenguaje con imágenes, audio, video, acciones u otras modalidades.
Modelo fundacional. Modelo amplio que puede adaptarse a numerosas tareas y aplicaciones.
Un modelo de lenguaje puede ser grande sin poseer todas las funciones de un asistente moderno. La expresión LLM describe principalmente escala, arquitectura y entrenamiento, mientras funciones como búsqueda, memoria, voz, ejecución y navegación pertenecen al sistema completo.
Contexto histórico y evolución
La historia de los modelos de lenguaje se relaciona con la teoría de la información, la estadística, la lingüística computacional y el aprendizaje automático.
Antecedentes probabilísticos
Durante la primera mitad del siglo XX se desarrollaron métodos probabilísticos para estudiar secuencias, comunicación y transmisión de información. Las cadenas de Markov mostraron que podía modelarse una secuencia mediante probabilidades condicionadas por estados anteriores.
Claude Shannon aplicó ideas probabilísticas al lenguaje dentro de su teoría matemática de la comunicación. Sus experimentos mostraron que la predictibilidad de las letras y palabras podía utilizarse para analizar redundancia, entropía y transmisión de mensajes.
La idea de asignar probabilidades a secuencias permitió abordar reconocimiento de voz, traducción, compresión, corrección y predicción.
Modelos de n-gramas
Los modelos de n-gramas estiman la probabilidad de una unidad utilizando una ventana limitada de elementos anteriores.
Un unigrama considera cada palabra de manera independiente.
Un bigrama utiliza la palabra anterior.
Un trigrama utiliza las dos palabras anteriores.
Un n-grama de orden superior incorpora una secuencia más larga, aunque aumenta el número de combinaciones posibles y la escasez de datos.
Estos modelos adquirieron gran importancia durante el desarrollo de sistemas de reconocimiento de voz y traducción estadística. Sus ventajas incluían simplicidad, interpretabilidad y eficiencia relativa.
Su principal dificultad aparece cuando una secuencia no fue observada dentro del corpus. Para resolver este problema se desarrollaron técnicas de suavizado, retroceso, interpolación y descuento.
Modelos estadísticos avanzados
Los investigadores desarrollaron métodos como Good-Turing, Katz backoff y Kneser-Ney para redistribuir probabilidad hacia eventos poco frecuentes o no observados.
Los modelos estadísticos permitieron construir sistemas robustos sobre grandes corpus, aunque permanecían limitados por ventanas fijas, representaciones discretas y crecimiento combinatorio del vocabulario.
Primeros modelos neuronales
Los modelos neuronales sustituyeron parte de los conteos discretos por representaciones continuas.
En 2003, Yoshua Bengio, Réjean Ducharme, Pascal Vincent y Christian Jauvin presentaron un modelo neuronal probabilístico que aprendía simultáneamente representaciones distribuidas de palabras y una función para predecir la siguiente unidad.
Este enfoque ayudó a enfrentar la denominada maldición de la dimensionalidad, porque palabras y contextos similares podían compartir información mediante vectores continuos.
Los modelos neuronales iniciales utilizaban ventanas fijas y redes feed-forward. Su entrenamiento resultaba costoso porque debían calcular probabilidades sobre vocabularios extensos.
Representaciones distribuidas
Durante la década de 2010 se popularizaron modelos capaces de aprender vectores de palabras.
Word2vec introdujo arquitecturas como CBOW y Skip-gram, que aprendían representaciones mediante predicción de palabras y contextos. Estas representaciones capturaban determinadas relaciones sintácticas y semánticas.
Los embeddings estáticos asignaban un vector principal a cada palabra. Esta solución presentaba dificultades ante polisemia, porque términos como «banco» podían referirse a una institución financiera, un asiento o una formación geográfica sin cambiar su representación básica.
Redes neuronales recurrentes
Las redes neuronales recurrentes procesan secuencias conservando un estado que resume información previa.
Los modelos recurrentes permitieron utilizar contextos variables y mejorar la generación, reconocimiento de voz y traducción.
Las arquitecturas LSTM y GRU redujeron algunos problemas asociados con gradientes que desaparecían o crecían durante el entrenamiento. Sus mecanismos de memoria facilitaron la conservación de dependencias más extensas.
La ejecución secuencial limitaba la paralelización y dificultaba el entrenamiento eficiente sobre corpus muy grandes.
Modelos secuencia a secuencia
Los modelos encoder-decoder transformaban una secuencia de entrada en una representación intermedia y generaban posteriormente una secuencia de salida.
Esta arquitectura se utilizó en traducción, resumen y diálogo. El mecanismo de atención permitió que el decodificador consultara diferentes partes de la entrada en lugar de depender de una sola representación comprimida.
Representaciones contextuales
ELMo mostró que una palabra podía recibir una representación diferente según la frase donde aparecía. El modelo combinaba información procedente de redes bidireccionales entrenadas sobre lenguaje.
Las representaciones contextuales mejoraron tareas como etiquetado, análisis sintáctico, respuesta a preguntas y reconocimiento de entidades.
Transformer
En 2017, el artículo Attention Is All You Need presentó el transformer, arquitectura basada en mecanismos de atención y carente de recurrencia dentro de su diseño central.
La atención permite relacionar cada token con otros elementos de la secuencia y calcular qué partes del contexto resultan relevantes.
La eliminación de la recurrencia facilitó el entrenamiento paralelo y favoreció el escalamiento hacia modelos y corpus mayores.
El transformer se convirtió en la arquitectura dominante de numerosos modelos lingüísticos, visuales, científicos y multimodales.
Preentrenamiento generativo
GPT mostró que un modelo transformer podía preentrenarse mediante predicción autoregresiva sobre grandes corpus y adaptarse posteriormente a tareas supervisadas.
GPT-2 amplió la escala y mostró que un modelo podía ejecutar algunas tareas a partir de descripciones, formatos y contexto sin modificar necesariamente todos sus parámetros.
GPT-3 demostró un crecimiento importante del aprendizaje zero-shot, one-shot y few-shot mediante prompts y ejemplos incluidos en la entrada.
Modelos bidireccionales
BERT introdujo un preentrenamiento profundo bidireccional basado principalmente en reconstrucción de tokens enmascarados.
El modelo podía utilizar simultáneamente contexto izquierdo y derecho para crear representaciones útiles en clasificación, respuesta a preguntas e inferencia lingüística.
BERT se diseñó principalmente como codificador y no como generador autoregresivo de texto prolongado.
Modelos encoder-decoder preentrenados
Modelos como T5 formularon diferentes tareas lingüísticas como transformaciones de texto a texto.
El sistema podía recibir una entrada con una instrucción o prefijo y generar una salida textual, lo que facilitó unificar traducción, resumen, clasificación y respuesta.
Otros modelos encoder-decoder, como BART, combinaron objetivos de reconstrucción con generación.
Escalamiento
Las investigaciones sobre leyes de escalamiento encontraron relaciones empíricas entre pérdida, cantidad de parámetros, volumen de datos y cómputo utilizado durante el entrenamiento.
El aumento de tamaño produjo mejoras en diferentes tareas, aunque la eficiencia dependía de equilibrar parámetros, datos y presupuesto computacional.
El trabajo de Chinchilla mostró que varios modelos grandes habían sido entrenados con menos datos de los convenientes para su escala y que un modelo de menor tamaño podía superar sistemas mayores cuando recibía una cantidad más adecuada de tokens de entrenamiento.
Alineación mediante instrucciones
Los modelos base predicen secuencias, aunque no necesariamente siguen instrucciones de manera útil o segura.
El instruction tuning utiliza conjuntos de tareas y demostraciones para enseñar a responder a solicitudes humanas.
La retroalimentación humana y los métodos de optimización de preferencias permiten ajustar el comportamiento hacia respuestas consideradas más útiles, seguras o compatibles con determinados criterios.
Modelos conversacionales y agénticos
Los modelos alineados se integraron con interfaces conversacionales, memoria temporal, búsqueda, ejecución de código y herramientas.
Los agentes utilizan modelos de lenguaje como componentes de planificación y control, aunque necesitan sistemas adicionales para permisos, ejecución, observación y recuperación.
La evolución contemporánea incluye modelos multimodales, ventanas de contexto mayores, técnicas de recuperación, razonamiento asistido, modelos especializados y sistemas pequeños destinados a ejecución local.
Fundamentos teóricos
Probabilidad condicional
Un modelo estima la probabilidad de una unidad según un contexto.
En un modelo autoregresivo:
<math>P(w_t\mid w_1,\ldots,w_{t-1})</math>
representa la probabilidad del elemento situado en la posición t a partir de los elementos anteriores.
Regla de la cadena
La probabilidad de una secuencia completa puede descomponerse en el producto de probabilidades condicionales.
Esta propiedad permite entrenar un modelo mediante predicción sucesiva.
Supuesto de Markov
Los modelos de n-gramas simplifican el cálculo suponiendo que la probabilidad depende únicamente de una cantidad limitada de elementos anteriores.
Un trigrama aproxima:
<math>P(w_t\mid w_1,\ldots,w_{t-1})</math>
mediante:
<math>P(w_t\mid w_{t-2},w_{t-1})</math>
La aproximación reduce complejidad y pierde dependencias distantes.
Máxima verosimilitud
El entrenamiento suele buscar parámetros que asignen una probabilidad elevada a los datos observados.
En modelos neuronales, esta optimización se realiza mediante descenso de gradiente y retropropagación.
Entropía cruzada
La entropía cruzada mide la diferencia entre la distribución esperada y la distribución predicha por el modelo.
Durante el entrenamiento autoregresivo, el sistema recibe el token correcto y ajusta sus parámetros para aumentar su probabilidad.
Perplejidad
La perplejidad se deriva de la entropía cruzada y representa el grado de incertidumbre promedio del modelo.
Una perplejidad menor indica que el sistema asigna mayor probabilidad a la secuencia evaluada.
La comparación resulta válida cuando los modelos utilizan tokenizaciones, corpus y condiciones compatibles. Una perplejidad inferior tampoco garantiza mayor factualidad, seguridad, utilidad o desempeño en todas las tareas.
Representaciones distribuidas
Las palabras y tokens se convierten en vectores dentro de espacios continuos.
Las representaciones cercanas pueden compartir propiedades y permitir generalización entre contextos relacionados.
Embeddings contextuales
Los transformers producen representaciones que cambian según la posición y el contexto. El vector de una palabra depende de las unidades que la rodean.
Atención
La atención calcula relaciones entre consultas, claves y valores.
Cada token puede asignar diferentes pesos a otros elementos de la secuencia. Los resultados se combinan para construir representaciones contextuales.
Atención multicabeza
La atención multicabeza permite que diferentes cabezas aprendan patrones complementarios, como relaciones sintácticas, dependencias, posición o correspondencias semánticas.
Las cabezas no poseen necesariamente funciones fijas e interpretables, y los pesos de atención no deben considerarse una explicación completa del comportamiento.
Posición
La atención por sí sola carece de información inherente sobre el orden. Los transformers incorporan codificaciones o representaciones posicionales.
Estas pueden ser absolutas, relativas, rotatorias u obtenidas mediante otros mecanismos.
Capas feed-forward
Cada bloque transformer combina atención con redes feed-forward aplicadas a las representaciones.
Normalización y conexiones residuales
Las conexiones residuales y las capas de normalización facilitan el entrenamiento de redes profundas.
Softmax
La función softmax transforma puntuaciones en una distribución de probabilidad sobre el vocabulario.
Muestreo
Durante la generación, el sistema selecciona tokens según sus probabilidades y parámetros de decodificación.
La elección del token más probable puede producir resultados repetitivos. El muestreo aumenta diversidad y también puede incrementar errores.
Funcionamiento
El funcionamiento de un modelo neuronal de lenguaje puede dividirse en entrenamiento e inferencia.
Preparación de datos
Los desarrolladores reúnen corpus procedentes de libros, sitios web, artículos, código, conversaciones, documentos y otras fuentes.
La preparación puede incluir:
- limpieza;
- normalización;
- filtrado;
- eliminación de duplicados;
- clasificación por idioma;
- detección de contenido;
- protección de datos;
- división en conjuntos;
- tokenización;
- mezcla de fuentes.
La composición del corpus influye en capacidades, idiomas, sesgos, estilos y conocimientos.
Tokenización
El texto se transforma en unidades numéricas.
Las estrategias incluyen:
- palabras completas;
- caracteres;
- bytes;
- subpalabras;
- combinaciones aprendidas.
Las subpalabras permiten representar vocabularios extensos y palabras desconocidas mediante fragmentos.
Métodos como byte-pair encoding, WordPiece, Unigram y SentencePiece se utilizan en diferentes modelos.
La tokenización afecta:
- longitud del contexto;
- eficiencia;
- tratamiento de idiomas;
- representación de números;
- código;
- costo de inferencia;
- desempeño multilingüe.
Los idiomas con menor presencia durante el diseño del vocabulario pueden necesitar más tokens para representar la misma cantidad de texto.
Embedding de entrada
Cada token se transforma en un vector.
El sistema añade información de posición y, en algunos casos, tipo de segmento, modalidad o fuente.
Procesamiento contextual
Las capas neuronales transforman sucesivamente las representaciones.
En un transformer, la autoatención permite relacionar tokens dentro del contexto permitido por la máscara del modelo.
Predicción
La representación final se proyecta hacia el vocabulario.
El modelo produce una distribución de probabilidades para el token objetivo.
Cálculo de pérdida
La distribución predicha se compara con el token correcto.
La pérdida se utiliza para calcular gradientes.
Actualización de parámetros
Los optimizadores modifican los pesos del modelo.
El proceso se repite sobre enormes cantidades de secuencias y lotes.
Inferencia
Durante la inferencia, el modelo recibe un prompt, tokeniza la entrada y calcula una continuación.
Cada token generado se incorpora al contexto para predecir el siguiente.
La generación termina cuando:
- aparece un token de finalización;
- se alcanza una longitud máxima;
- se cumple una secuencia de parada;
- una herramienta interrumpe el flujo;
- una aplicación determina que la respuesta terminó.
Objetivos de entrenamiento
Modelado autoregresivo
Predice el siguiente token utilizando los tokens anteriores.
Se utiliza en modelos generativos de tipo decoder-only.
Ventajas:
- generación natural de secuencias;
- adaptación mediante prompts;
- escalabilidad;
- aplicación a texto y código.
Limitaciones:
- entrenamiento unidireccional;
- propagación de errores durante generación;
- dependencia de decisiones previas.
Modelado enmascarado
Oculta algunos tokens y solicita reconstruirlos utilizando contexto bidireccional.
Se utiliza en modelos de tipo encoder.
Ventajas:
- representaciones profundas del contexto;
- utilidad en clasificación y extracción;
- uso de contexto izquierdo y derecho.
Limitaciones:
- diferencia entre el objetivo de preentrenamiento y algunas tareas de generación;
- menor adecuación directa para generación autoregresiva prolongada.
Modelado permutado
XLNet introdujo un objetivo autoregresivo que considera diferentes órdenes de factorización para aprovechar información bidireccional sin utilizar enmascaramiento convencional.
Denoising
Modelos como BART y T5 alteran una secuencia y aprenden a reconstruirla.
Las alteraciones pueden incluir eliminación, enmascaramiento, permutación y sustitución de fragmentos.
Secuencia a secuencia
El modelo aprende a transformar una entrada en una salida.
Se utiliza en traducción, resumen, reescritura y respuesta.
Contraste
Los objetivos contrastivos ayudan a distinguir representaciones relacionadas de ejemplos no relacionados.
Instruction tuning
El modelo aprende a responder a instrucciones mediante conjuntos de tareas y demostraciones.
Optimización por preferencias
Se utilizan comparaciones o valoraciones para aproximar el comportamiento a preferencias humanas.
Los métodos incluyen aprendizaje por refuerzo con retroalimentación humana y optimización directa de preferencias.
Arquitecturas principales
Modelos de n-gramas
Utilizan conteos de secuencias limitadas.
Resultan útiles cuando se necesita interpretabilidad, bajo costo o funcionamiento dentro de dominios muy delimitados.
Modelos feed-forward
Procesan una ventana fija de contexto mediante capas densas.
Introdujeron embeddings aprendidos conjuntamente con la predicción.
Modelos recurrentes
Mantienen un estado oculto que se actualiza al procesar cada elemento.
LSTM y GRU
Incorporan compuertas que regulan la conservación y modificación de información.
Encoder-decoder recurrente
Transforma una secuencia de entrada en una salida mediante estados y atención.
Transformer encoder
Procesa el contexto bidireccionalmente y produce representaciones.
BERT constituye un ejemplo representativo.
Transformer decoder
Utiliza atención causal y genera secuencias token por token.
GPT pertenece a esta familia.
Transformer encoder-decoder
El codificador procesa la entrada y el decodificador genera la salida consultando sus representaciones.
T5 y BART utilizan este enfoque.
Mixture of Experts
Los modelos de mezcla de expertos activan subconjuntos de parámetros según cada token o tarea.
Esta arquitectura permite aumentar capacidad total sin utilizar todos los parámetros durante cada operación.
Su funcionamiento introduce desafíos de balanceo, comunicación, entrenamiento y despliegue.
Modelos de estado de espacio
Las arquitecturas de estado de espacio buscan procesar secuencias largas con costos diferentes a la atención completa.
Pueden complementar o competir con transformers en determinadas aplicaciones.
Modelos híbridos
Combinan atención, recurrencia, convoluciones, memoria, recuperación o expertos.
Clasificación según función
Modelos generativos. Producen continuaciones y nuevas secuencias.
Modelos representacionales. Generan embeddings contextuales para clasificación, búsqueda o extracción.
Modelos encoder-only. Se orientan principalmente a comprensión y representación.
Modelos decoder-only. Se orientan principalmente a generación autoregresiva.
Modelos encoder-decoder. Transforman una entrada en una salida.
Modelos especializados. Se entrenan o adaptan para sectores, idiomas, código, ciencia o documentos.
Modelos generalistas. Atienden numerosas tareas mediante instrucciones.
Modelos multilingües. Representan varios idiomas dentro del mismo sistema.
Modelos monolingües. Se concentran en una lengua.
Modelos de dominio. Utilizan datos de medicina, derecho, finanzas, marketing u otros campos.
Modelos multimodales. Relacionan lenguaje con imágenes, audio y video.
Modelos locales. Se ejecutan en dispositivos o infraestructura controlada.
Modelos administrados. Se consumen mediante servicios en la nube.
Modelos abiertos. Proporcionan pesos, código o documentación bajo diferentes condiciones.
Modelos propietarios. Funcionan dentro de servicios controlados por una organización.
Grandes modelos de lenguaje
Un modelo de lenguaje de gran tamaño es un modelo neuronal preentrenado con cantidades elevadas de parámetros, datos y cómputo.
El adjetivo «grande» carece de un límite universal. Un modelo considerado grande en una etapa histórica puede resultar pequeño frente a sistemas posteriores.
Los LLM suelen caracterizarse por:
- arquitectura transformer o relacionada;
- preentrenamiento autosupervisado;
- grandes corpus;
- numerosos parámetros;
- adaptación mediante prompts;
- aprendizaje en contexto;
- capacidad multitécnica;
- posibilidad de ajuste;
- integración con herramientas.
El tamaño contribuye al desempeño, aunque no constituye la única variable. La calidad de datos, la cantidad de tokens, la arquitectura, el entrenamiento posterior, las herramientas y las evaluaciones también influyen.
Un modelo pequeño bien entrenado puede superar un sistema mayor en tareas especializadas, costos, latencia, privacidad o ejecución local.
Aprendizaje en contexto
El aprendizaje en contexto permite que un modelo adapte temporalmente su comportamiento mediante instrucciones y ejemplos incluidos dentro de la entrada.
Zero-shot
El modelo recibe una tarea sin ejemplos específicos.
One-shot
Recibe una demostración.
Few-shot
Recibe varias demostraciones.
Este aprendizaje ocurre durante inferencia y no modifica necesariamente los parámetros del modelo.
Su eficacia depende de:
- claridad de instrucciones;
- calidad de ejemplos;
- orden;
- similitud con la tarea;
- modelo;
- idioma;
- longitud;
- formato.
El aprendizaje en contexto puede producir resultados potentes, aunque resulta sensible a formulaciones, ejemplos y posición dentro del prompt.
Ventana de contexto
La ventana de contexto representa la cantidad máxima de tokens que un modelo puede procesar durante una interacción.
Puede incluir:
- instrucciones;
- conversación;
- documentos;
- resultados de herramientas;
- código;
- memoria recuperada;
- respuesta generada.
Una ventana amplia permite trabajar con documentos y repositorios mayores, aunque su disponibilidad no garantiza que todos los elementos reciban la misma atención.
Los modelos pueden presentar dificultades para recuperar información situada en determinadas posiciones o para integrar numerosos detalles dispersos.
La ingeniería de contexto selecciona, organiza, resume y recupera información para utilizar la ventana de manera eficiente.
Generación y decodificación
El modelo produce una distribución sobre el vocabulario. La aplicación necesita elegir cómo seleccionar el siguiente token.
Greedy decoding
Selecciona el token con mayor probabilidad en cada paso.
Puede producir respuestas estables y repetitivas.
Beam search
Conserva varias secuencias candidatas y busca una combinación con alta probabilidad.
Se utilizó ampliamente en traducción y tareas secuencia a secuencia.
Muestreo por temperatura
La temperatura modifica la distribución.
Una temperatura baja concentra probabilidad en opciones frecuentes.
Una temperatura alta aumenta diversidad y riesgo.
Top-k
Limita la selección a los k tokens más probables.
Top-p
Selecciona el conjunto mínimo de tokens cuya probabilidad acumulada alcanza un umbral.
Penalizaciones
Algunos sistemas aplican penalizaciones para reducir repetición o favorecer diversidad.
La configuración adecuada depende de la tarea. La escritura creativa puede tolerar variación, mientras la extracción estructurada necesita mayor control.
Evaluación
La evaluación de modelos de lenguaje necesita combinar métricas intrínsecas, benchmarks, pruebas específicas y evaluación humana.
Pérdida
Mide el error durante predicción.
Entropía cruzada
Evalúa la diferencia entre la distribución estimada y el token correcto.
Perplejidad
Representa incertidumbre promedio sobre una secuencia.
Exactitud
Se utiliza cuando existe una respuesta concreta.
Exact match
Exige coincidencia completa entre salida y referencia.
F1
Combina precisión y exhaustividad en tareas como extracción y respuesta.
BLEU
Compara n-gramas entre traducciones generadas y referencias.
ROUGE
Evalúa solapamiento y recuperación de unidades, especialmente en resumen.
BERTScore
Compara similitud mediante representaciones contextuales.
MMLU
Evalúa preguntas de opción múltiple en diferentes campos académicos.
GLUE y SuperGLUE
Agrupan tareas de comprensión lingüística.
SQuAD
Evalúa respuesta a preguntas sobre textos.
HumanEval
Evalúa generación de código mediante pruebas.
Evaluación humana
Personas califican utilidad, corrección, claridad, coherencia, estilo y seguridad.
Evaluación factual
Comprueba correspondencia con fuentes y conocimiento verificable.
Evaluación de seguridad
Analiza comportamiento ante solicitudes adversariales, sesgos, información sensible y usos indebidos.
Evaluaciones propias
Las organizaciones deben crear conjuntos relacionados con sus procesos, clientes, idiomas y riesgos.
Un benchmark puede saturarse, contaminarse o dejar de representar el uso real. El desempeño promedio tampoco garantiza calidad en casos particulares.
Capacidades
Los modelos de lenguaje pueden apoyar:
- generación;
- resumen;
- traducción;
- reescritura;
- clasificación;
- extracción;
- respuesta a preguntas;
- recuperación;
- análisis de sentimiento;
- reconocimiento de entidades;
- corrección;
- programación;
- planificación;
- diálogo;
- explicación;
- creación de embeddings;
- uso de herramientas.
Las capacidades observadas dependen de la arquitectura y del sistema completo. Un modelo base puede necesitar ajuste, instrucciones o herramientas para desempeñarse adecuadamente.
Aplicaciones generales
Reconocimiento de voz
El modelo lingüístico ayuda a seleccionar transcripciones plausibles entre diferentes interpretaciones acústicas.
Traducción automática
Relaciona secuencias en distintos idiomas y genera una traducción condicionada por el texto original.
Corrección ortográfica
Evalúa qué palabra resulta probable dentro de un contexto.
Predicción de escritura
Sugiere palabras y frases mientras una persona escribe.
Motores de búsqueda
Apoya comprensión de consultas, expansión semántica, recuperación y generación de respuestas.
Resumen
Condensa documentos, conversaciones y reportes.
Clasificación
Asigna temas, intención, sentimiento, prioridad o categoría.
Extracción de información
Identifica nombres, fechas, productos, cantidades, relaciones y eventos.
Respuesta a preguntas
Genera respuestas desde conocimiento paramétrico o fuentes recuperadas.
Programación
Genera código, explica repositorios, crea pruebas y corrige errores.
Chatbots
Mantiene conversaciones y produce respuestas contextualizadas.
Educación
Genera explicaciones, ejercicios y retroalimentación.
Investigación
Ayuda a organizar literatura, hipótesis, notas y datos.
Documentación
Produce manuales, resúmenes y descripciones técnicas.
Aplicaciones en marketing
Los modelos de lenguaje transforman tareas de marketing que dependen de texto, conversaciones, conocimiento y datos no estructurados.
Investigación de mercados
Pueden:
- resumir entrevistas;
- clasificar respuestas;
- identificar temas;
- comparar segmentos;
- detectar necesidades;
- organizar hipótesis;
- convertir notas en estructuras.
Los resultados necesitan contrastarse con datos originales porque el modelo puede simplificar contradicciones o proyectar patrones inexistentes.
Voz del cliente
Los modelos permiten analizar reseñas, tickets, chats, llamadas transcritas y encuestas.
Pueden identificar:
- motivos de satisfacción;
- objeciones;
- problemas frecuentes;
- lenguaje utilizado;
- expectativas;
- características valoradas.
El análisis debe conservar frecuencia, contexto y procedencia para evitar convertir ejemplos aislados en conclusiones generales.
Segmentación
Los modelos pueden etiquetar clientes según intención, necesidad, etapa, comportamiento o problema.
Las categorías deben definirse con criterios comerciales y revisarse para evitar inferencias sensibles o discriminatorias.
Buyer persona
Pueden organizar datos de investigación dentro de perfiles narrativos.
La generación de personas sin evidencia produce estereotipos plausibles que pueden desorientar la estrategia.
Marketing de contenidos
Permiten:
- generar esquemas;
- redactar borradores;
- resumir fuentes;
- adaptar niveles;
- reutilizar contenidos;
- proponer títulos;
- editar;
- traducir;
- actualizar;
- clasificar archivos.
La producción requiere experiencia, edición y aportaciones propias para evitar homogeneidad y AI slop.
SEO
Los modelos pueden apoyar:
- agrupación de palabras clave;
- análisis de intención;
- extracción de entidades;
- comparación de contenidos;
- generación de metadatos;
- enlazado interno;
- auditorías;
- datos estructurados;
- detección de huecos;
- actualización editorial.
La generación escalada de páginas sin utilidad puede deteriorar calidad y reputación.
AEO
En AEO, los modelos ayudan a estructurar preguntas y respuestas comprensibles para motores de respuesta.
GEO
En GEO, pueden analizar entidades, citas, relaciones y contenidos que podrían ser recuperados por sistemas generativos.
También pueden utilizarse para evaluar representaciones de marca, aunque la variabilidad de respuestas exige múltiples pruebas.
Publicidad digital
Los modelos generan titulares, descripciones, guiones, variantes y adaptaciones.
Las afirmaciones comerciales deben verificarse y cumplir políticas, leyes y evidencia disponible.
Email marketing
Pueden producir asuntos, secuencias, resúmenes y personalizaciones.
La personalización debe apoyarse en datos autorizados y evitar inferencias intrusivas.
CRM
Los modelos resumen conversaciones, extraen compromisos, clasifican oportunidades y sugieren siguientes pasos.
La información generada debe distinguirse de los datos confirmados por el cliente.
Ventas
Pueden apoyar:
- preparación de llamadas;
- investigación;
- respuestas a objeciones;
- propuestas;
- simulaciones;
- seguimiento;
- capacitación.
Servicio al cliente
Los modelos pueden responder consultas, resumir casos, clasificar tickets y asistir a agentes humanos.
Los procesos necesitan mecanismos de transferencia cuando la solicitud excede capacidades o autoridad.
Marketing conversacional
Funcionan como núcleo lingüístico de chatbots, asistentes y agentes de voz.
La aplicación añade identidad, reglas, fuentes, memoria, canales y acciones.
E-commerce
Pueden generar descripciones, responder preguntas, organizar atributos, comparar productos y apoyar recomendaciones.
Las respuestas deben utilizar información real de inventario, precio y compatibilidad.
Marketing local
Ayudan a adaptar contenidos a ubicaciones, servicios, horarios, sucursales y contextos regionales.
La generación necesita datos verificables para evitar páginas ficticias o información desactualizada.
Analítica de marketing
Pueden convertir preguntas en consultas, explicar métricas y resumir paneles.
Los cálculos y relaciones causales requieren validación mediante datos y herramientas.
Inteligencia competitiva
Permiten resumir páginas, anuncios, publicaciones, reseñas y documentos públicos.
La salida debe conservar fecha, fuente y distinción entre observación e inferencia.
Gestión de reputación
Pueden clasificar reseñas, detectar temas y preparar respuestas preliminares.
Social listening
Ayudan a organizar menciones, conversaciones, tendencias, intención y sentimiento.
La ironía, el contexto cultural y la ambigüedad pueden producir errores.
Marketing de influencers
Pueden analizar temas, formatos, tono, colaboraciones y afinidad.
La selección necesita métricas, revisión humana y análisis reputacional.
Branding
Apoyan exploración de nombres, posicionamientos, narrativas y guías verbales.
La diferenciación depende del conocimiento estratégico, la investigación y las decisiones humanas.
Automatización de marketing
Los modelos pueden incorporarse a flujos para:
- clasificar leads;
- extraer información;
- redactar respuestas;
- resumir actividad;
- seleccionar plantillas;
- actualizar sistemas.
La automatización necesita límites, validación y observabilidad.
Ventajas del concepto
Modelado del contexto. Permite interpretar una unidad según las palabras que la rodean.
Generalización. Puede trabajar con secuencias no observadas exactamente durante entrenamiento.
Flexibilidad. Un modelo preentrenado puede adaptarse a varias tareas.
Procesamiento de información no estructurada. Convierte texto libre en categorías, resúmenes y datos.
Generación. Produce nuevas secuencias condicionadas por instrucciones.
Escalabilidad. Puede procesar grandes cantidades de contenido.
Multilingüismo. Algunos modelos trabajan con numerosos idiomas.
Aprendizaje en contexto. Permite especificar tareas mediante ejemplos.
Transferencia. El conocimiento preentrenado puede reutilizarse.
Interfaz natural. Las personas interactúan mediante lenguaje cotidiano.
Automatización. Puede integrarse en procesos empresariales.
Personalización. Adapta mensajes según contexto autorizado.
Representaciones semánticas. Los embeddings facilitan búsqueda y clasificación.
Asistencia profesional. Reduce trabajo repetitivo y acelera borradores.
Prototipado. Permite crear rápidamente experiencias conversacionales.
Limitaciones
Alucinaciones. El modelo puede producir afirmaciones incorrectas con apariencia convincente.
Objetivo probabilístico. La predicción lingüística no equivale a comprobación factual.
Dependencia de datos. El comportamiento refleja contenidos y omisiones del entrenamiento.
Sesgos. Puede reproducir estereotipos, desigualdades y asociaciones dañinas.
Conocimiento temporal limitado. Puede carecer de información reciente sin herramientas externas.
Contexto finito. No puede procesar cantidades ilimitadas de información.
Pérdida de información. Puede omitir detalles o relaciones dentro de textos extensos.
Sensibilidad al prompt. Las respuestas cambian según formulación y ejemplos.
Variabilidad. Una misma entrada puede generar salidas distintas.
Falta de trazabilidad. Puede resultar difícil identificar el origen de una afirmación.
Razonamiento imperfecto. Los modelos pueden cometer errores lógicos, matemáticos y causales.
Comprensión discutida. El desempeño lingüístico no demuestra necesariamente comprensión humana, experiencia o conciencia.
Dependencia de tokenización. Los idiomas y formatos pueden recibir representaciones desiguales.
Costos. El entrenamiento y la inferencia pueden requerir recursos elevados.
Latencia. La generación y uso de herramientas pueden retrasar respuestas.
Privacidad. Los prompts pueden contener información sensible.
Seguridad. Los modelos pueden ser manipulados mediante prompt injection.
Propiedad intelectual. El entrenamiento y las salidas plantean cuestiones legales.
Homogeneización. El uso extendido puede producir mensajes y estilos similares.
Sobreautomatización. Las organizaciones pueden sustituir criterio por generación masiva.
Dificultad de evaluación. Las tareas abiertas carecen frecuentemente de una única respuesta correcta.
Alucinaciones
Una alucinación de inteligencia artificial ocurre cuando el modelo produce información falsa, inventada o no respaldada.
Puede incluir:
- referencias inexistentes;
- datos incorrectos;
- atribuciones falsas;
- citas fabricadas;
- fechas erróneas;
- funciones de software inexistentes;
- conclusiones no sostenidas por la fuente.
Las alucinaciones aparecen porque el modelo optimiza plausibilidad lingüística y carece de una verificación automática universal.
Las mitigaciones incluyen:
- recuperación de fuentes;
- herramientas de búsqueda;
- bases de datos;
- formatos estructurados;
- instrucciones de incertidumbre;
- evaluación factual;
- revisión humana;
- límites de dominio;
- citas comprobables.
RAG reduce determinados errores y puede introducir otros cuando recupera documentos irrelevantes, desactualizados o contradictorios.
Sesgos y representación
Los corpus contienen distribuciones desiguales de idiomas, culturas, ocupaciones, géneros, regiones e ideologías.
Un modelo puede:
- asociar grupos con estereotipos;
- ofrecer menor calidad en lenguas poco representadas;
- favorecer perspectivas dominantes;
- amplificar toxicidad;
- reproducir prejuicios históricos;
- interpretar incorrectamente dialectos;
- generar recomendaciones discriminatorias.
La mitigación requiere datos, evaluaciones, políticas, especialistas, mecanismos de apelación y monitoreo.
Eliminar términos ofensivos del corpus no resuelve por sí solo relaciones estructurales ni daños contextuales.
Seguridad
Los modelos de lenguaje presentan riesgos específicos.
Prompt injection. Una entrada intenta desplazar instrucciones legítimas.
Jailbreaking. Busca eludir controles de seguridad.
Exfiltración de datos. El sistema puede ser manipulado para revelar información.
Memorización. Algunos modelos pueden reproducir fragmentos presentes en entrenamiento.
Envenenamiento de datos. El corpus o las fuentes pueden manipularse.
Ataques adversariales. Entradas diseñadas provocan comportamientos inesperados.
Uso de herramientas. Un agente puede ejecutar acciones peligrosas.
Código inseguro. El modelo puede producir vulnerabilidades.
Phishing y fraude. Facilita mensajes personalizados a escala.
Suplantación. Puede utilizarse junto con voz e imagen sintética.
Las aplicaciones deben aplicar privilegio mínimo, aislamiento, validación, monitoreo y revisión humana.
Privacidad
Los modelos pueden procesar:
- datos personales;
- conversaciones;
- historiales;
- documentos;
- código privado;
- información comercial;
- credenciales;
- datos sensibles.
Las organizaciones deben revisar:
- retención;
- cifrado;
- uso para entrenamiento;
- residencia;
- permisos;
- eliminación;
- subprocesadores;
- registros;
- base legal;
- consentimiento.
Los datos sensibles no deben incluirse en herramientas carentes de autorización y controles suficientes.
Costos y recursos
El desarrollo de modelos requiere:
- datos;
- procesadores especializados;
- almacenamiento;
- redes;
- electricidad;
- refrigeración;
- investigación;
- evaluación;
- seguridad;
- operación.
La inferencia también consume recursos, especialmente cuando el contexto, la salida o el número de usuarios aumenta.
La cuantización, destilación, caché, batching, modelos pequeños y arquitecturas eficientes pueden reducir costos.
El costo total incluye licencias, integración, supervisión, monitoreo, revisión y corrección de errores.
Modelos multilingües
Los modelos multilingües se entrenan con textos procedentes de varios idiomas.
Pueden transferir conocimientos entre lenguas y ejecutar traducción o clasificación sin modelos separados.
El desempeño suele variar debido a:
- cantidad de datos;
- calidad;
- tokenización;
- proximidad lingüística;
- dominio;
- alfabeto;
- alineación;
- evaluación disponible.
Los idiomas de bajos recursos pueden recibir respuestas menos precisas y consumir más tokens.
La inclusión nominal de un idioma dentro del corpus no garantiza dominio cultural, dialectal o regional.
Modelos pequeños de lenguaje
Los modelos de lenguaje pequeños utilizan menos parámetros y recursos.
Sus ventajas pueden incluir:
- menor latencia;
- ejecución local;
- privacidad;
- reducción de costos;
- adaptación;
- uso en dispositivos;
- control.
Pueden resultar adecuados para clasificación, extracción, comandos, dominios delimitados y tareas repetitivas.
Sus capacidades generales suelen ser inferiores a las de modelos mayores, aunque la especialización, las herramientas y los datos pueden compensar parte de la diferencia.
Adaptación
Fine-tuning
El fine-tuning modifica parámetros mediante entrenamiento adicional.
Puede utilizarse para enseñar formatos, estilos, tareas y comportamientos repetitivos.
LoRA y adaptadores
Actualizan una cantidad reducida de parámetros y disminuyen recursos necesarios.
Instruction tuning
Entrena al modelo para responder a instrucciones.
Preferencias
Se utilizan comparaciones y evaluaciones para orientar el comportamiento.
RAG
RAG incorpora información externa al contexto.
Prompt engineering
Diseña instrucciones, ejemplos y formatos.
Ingeniería de contexto
Administra fuentes, memoria, herramientas, historial y selección de información.
Herramientas
Permiten buscar, calcular, ejecutar y consultar sistemas.
La estrategia adecuada depende de si el problema se relaciona con conocimiento cambiante, comportamiento, estilo, formato, privacidad o costo.
Herramientas y plataformas
ChatGPT. Aplicación conversacional basada en modelos de OpenAI.
OpenAI API. Permite integrar modelos de lenguaje, herramientas y agentes.
Claude. Familia de modelos y asistentes de Anthropic.
Gemini. Familia de modelos multimodales de Google.
Microsoft Copilot. Integra modelos de lenguaje en productos y procesos empresariales.
GitHub Copilot. Se especializa en programación asistida.
Amazon Bedrock. Proporciona acceso administrado a varios modelos.
Vertex AI. Plataforma para desarrollar y desplegar soluciones con modelos.
Azure AI. Integra modelos, búsqueda, agentes y gobernanza.
IBM watsonx. Proporciona modelos, datos y herramientas empresariales.
Hugging Face. Reúne modelos, datasets, bibliotecas y aplicaciones.
Llama. Familia de modelos desarrollada por Meta.
Mistral. Familia de modelos y servicios de Mistral AI.
Cohere. Desarrolla modelos orientados a aplicaciones empresariales y recuperación.
AI21 Labs. Ofrece modelos y herramientas lingüísticas.
Ollama. Facilita la ejecución local de modelos compatibles.
LM Studio. Proporciona una interfaz para utilizar modelos locales.
Transformers. Biblioteca de Hugging Face para modelos preentrenados.
PyTorch. Framework utilizado para entrenamiento e inferencia.
TensorFlow. Plataforma de aprendizaje automático.
JAX. Sistema de computación numérica utilizado en investigación y entrenamiento.
vLLM. Motor de inferencia para modelos de lenguaje.
llama.cpp. Permite ejecutar modelos cuantizados en diferentes dispositivos.
LangChain. Framework para aplicaciones con modelos, herramientas y agentes.
LlamaIndex. Se orienta a recuperación y conexión con datos.
LangGraph. Construye flujos agénticos con estado.
La selección debe considerar tarea, idioma, privacidad, costo, latencia, contexto, licencias y portabilidad.
Relación con otros conceptos
Procesamiento del lenguaje natural. Campo donde se desarrollan y aplican modelos lingüísticos.
Lingüística computacional. Estudia el lenguaje mediante métodos computacionales.
Inteligencia artificial. Campo general al que pertenecen los modelos modernos.
Aprendizaje automático. Permite aprender patrones a partir de datos.
Aprendizaje profundo. Utiliza redes neuronales con múltiples capas.
Modelo de lenguaje de gran tamaño. Modelo de lenguaje neuronal de escala elevada.
Modelo de lenguaje pequeño. Modelo compacto orientado a eficiencia.
Modelo fundacional. Modelo adaptable a múltiples tareas.
Transformer. Arquitectura dominante en modelos contemporáneos.
Red neuronal recurrente. Arquitectura secuencial utilizada históricamente.
LSTM. Red recurrente con mecanismos de memoria.
Embedding. Representación vectorial de unidades.
Token. Unidad procesada por el modelo.
Tokenización. Proceso de dividir y codificar la entrada.
Ventana de contexto. Cantidad de información procesable.
Atención. Mecanismo para relacionar elementos de una secuencia.
Modelo autoregresivo. Predice cada unidad según las anteriores.
Modelo enmascarado de lenguaje. Reconstruye unidades ocultas.
Aprendizaje en contexto. Adapta la tarea mediante instrucciones y ejemplos.
Zero-shot learning. Ejecuta una tarea sin demostraciones específicas.
Few-shot learning. Utiliza varias demostraciones contextuales.
Prompt. Entrada que orienta la respuesta.
Prompt engineering. Diseña y evalúa instrucciones.
Ingeniería de contexto. Administra información y herramientas.
Fine-tuning. Adapta parámetros mediante entrenamiento adicional.
RAG. Recupera información externa antes de generar.
Inteligencia artificial generativa. Campo que utiliza modelos para producir nuevos contenidos.
Agentes de inteligencia artificial. Sistemas que utilizan modelos y herramientas para actuar.
Programación asistida por inteligencia artificial. Aplica modelos al desarrollo de software.
Vibe coding. Genera software mediante interacción conversacional.
Desarrollo agéntico. Integra agentes dentro del ciclo de software.
Alucinación de inteligencia artificial. Generación de contenido falso o no sustentado.
Prompt injection. Manipulación del modelo mediante instrucciones maliciosas.
Gobernanza de inteligencia artificial. Administra riesgos, políticas y responsabilidades.
Diferencias con un gran modelo de lenguaje
Modelo de lenguaje es la categoría general.
Un gran modelo de lenguaje es una variante neuronal entrenada con gran cantidad de datos, parámetros y cómputo.
Todos los LLM son modelos de lenguaje, mientras numerosos modelos de lenguaje no alcanzan una escala que justifique la categoría LLM.
Los modelos de n-gramas, sistemas recurrentes pequeños y predictores locales también pertenecen al campo.
Diferencias con un chatbot
Un chatbot es una aplicación diseñada para mantener conversaciones.
Puede utilizar:
- reglas;
- árboles de decisión;
- recuperación;
- modelos de lenguaje;
- combinaciones híbridas.
El modelo genera o representa lenguaje, mientras el chatbot añade interfaz, flujo, identidad, memoria, políticas, fuentes y acciones.
Diferencias con inteligencia artificial generativa
La inteligencia artificial generativa comprende modelos que producen texto, imagen, audio, video, código y otras modalidades.
Un modelo de lenguaje se concentra en distribuciones y estructuras lingüísticas, aunque algunos modelos contemporáneos se amplían hacia la multimodalidad.
Un modelo de lenguaje generativo forma parte de la IA generativa.
Diferencias con un motor de búsqueda
Un motor de búsqueda recupera documentos e información desde un índice.
Un modelo de lenguaje genera una respuesta a partir de patrones y contexto.
Los sistemas modernos combinan ambas funciones mediante recuperación aumentada.
La generación sin búsqueda puede carecer de fuentes actuales. La búsqueda sin generación entrega documentos que el usuario debe interpretar.
Diferencias con embeddings
Un embedding es una representación vectorial.
Un modelo de lenguaje puede producir embeddings y utilizar embeddings internamente.
Los modelos dedicados a embeddings se optimizan para similitud, búsqueda y clasificación, mientras los modelos generativos se optimizan para producir secuencias.
Diferencias con una base de conocimiento
Una base de conocimiento almacena información explícita y actualizable.
El conocimiento paramétrico de un modelo se encuentra distribuido dentro de sus pesos y resulta difícil de consultar, corregir o atribuir de manera exacta.
Las aplicaciones combinan modelos con bases de conocimiento para mejorar actualización y trazabilidad.
Buenas prácticas
Definir la tarea antes de elegir el modelo. La selección debe responder al problema.
Evaluar alternativas simples. Reglas, búsqueda o clasificadores pueden resultar suficientes.
Utilizar un modelo proporcionado al riesgo. Las tareas pequeñas pueden usar sistemas compactos.
Proteger los datos. Deben aplicarse políticas de privacidad.
Conservar fuentes. Las respuestas factuales necesitan procedencia.
Diseñar prompts claros. El objetivo, contexto y formato deben ser explícitos.
Aplicar RAG cuando el conocimiento cambia. Las fuentes externas facilitan actualización.
Crear evaluaciones propias. Los benchmarks generales no representan todos los usos.
Probar idiomas y dialectos reales. La calidad multilingüe puede variar.
Medir factualidad. La fluidez debe separarse de la corrección.
Validar formatos. Las salidas estructuradas necesitan comprobación.
Mantener revisión humana. Las decisiones relevantes requieren responsabilidad.
Limitar herramientas. Los agentes deben tener privilegios mínimos.
Monitorear producción. Se necesitan registros, métricas y alertas.
Versionar modelos y prompts. Las actualizaciones cambian comportamiento.
Controlar costos. Debe medirse el costo por resultado útil.
Evaluar latencia. La experiencia depende del tiempo de respuesta.
Probar seguridad. Las aplicaciones necesitan evaluaciones adversariales.
Documentar limitaciones. Los usuarios deben comprender el alcance.
Preparar transferencia humana. Los asistentes necesitan escalamiento.
Auditar sesgos. Las salidas deben revisarse por grupo y contexto.
Mantener una estrategia de salida. Conviene evitar dependencia absoluta del proveedor.
Retirar datos y accesos obsoletos. La gobernanza incluye eliminación.
Errores comunes
Confundir probabilidad con verdad. Una secuencia probable puede ser falsa.
Elegir el modelo más grande por defecto. El tamaño puede elevar costo y latencia sin aportar valor proporcional.
No definir criterios de éxito. La utilidad queda sujeta a impresiones.
Confiar en benchmarks generales. El desempeño real puede diferir.
Publicar sin revisión. Las alucinaciones pueden afectar reputación.
Proporcionar datos sensibles. La información puede quedar expuesta.
Usar conocimiento paramétrico para datos actuales. Los precios, leyes y noticias necesitan fuentes.
Ignorar la tokenización. El costo y desempeño varían según idioma.
Automatizar decisiones sensibles. El modelo puede reproducir sesgos y errores.
Confundir chatbot con modelo. Las capacidades dependen de toda la aplicación.
Solicitar citas sin recuperación. El modelo puede inventarlas.
No registrar versiones. Los resultados cambian con actualizaciones.
Medir calidad por longitud. Una respuesta extensa puede contener poco valor.
Generar contenido masivo. La abundancia puede producir slop.
No probar casos extremos. Las entradas reales incluyen ambigüedades y ataques.
Depender de un solo proveedor. Los cambios comerciales pueden afectar procesos.
Usar temperatura alta en extracción. La variabilidad puede deteriorar consistencia.
Asumir memoria permanente. El modelo puede carecer de historial fuera del contexto.
Guardar secretos en prompts. Las instrucciones no sustituyen controles técnicos.
Confundir explicación con razonamiento fiable. Una justificación puede ser incorrecta.
Desafíos éticos y organizacionales
Responsabilidad. La organización conserva responsabilidad por los resultados.
Transparencia. Los usuarios pueden necesitar saber que interactúan con un modelo.
Privacidad. Los textos contienen datos personales y comerciales.
Sesgo. El desempeño desigual puede afectar grupos e idiomas.
Propiedad intelectual. El entrenamiento y las salidas generan debates sobre derechos.
Trabajo. Las herramientas modifican tareas y competencias.
Dependencia. La automatización constante puede reducir capacidades humanas.
Vigilancia. Las plataformas pueden registrar conversaciones y actividad laboral.
Acceso desigual. Los mejores modelos pueden concentrarse en organizaciones con mayores recursos.
Concentración tecnológica. Pocos proveedores controlan infraestructura y distribución.
Impacto ambiental. Entrenamiento e inferencia consumen energía y recursos.
Desinformación. La generación puede escalar contenidos falsos.
Manipulación. Los mensajes pueden personalizarse para explotar vulnerabilidades.
Homogeneización cultural. Los modelos pueden favorecer patrones dominantes.
Representación lingüística. Las lenguas minoritarias pueden recibir menor calidad.
Autoría. La creación se distribuye entre datos, modelo, usuario y plataforma.
Gobernanza. Las organizaciones necesitan inventarios, políticas y responsables.
Gobernanza organizacional
Una política para modelos de lenguaje puede incluir:
- catálogo de modelos autorizados;
- clasificación de datos;
- evaluación de proveedores;
- niveles de riesgo;
- casos de uso permitidos;
- responsables;
- revisión humana;
- control de acceso;
- gestión de prompts;
- fuentes autorizadas;
- evaluaciones;
- seguridad;
- observabilidad;
- control de costos;
- trazabilidad;
- revisión legal;
- respuesta a incidentes;
- retiro de modelos.
Los casos pueden clasificarse por criticidad.
Riesgo bajo. Ideación, borradores y organización personal sin datos sensibles.
Riesgo moderado. Procesos internos con revisión.
Riesgo alto. Aplicaciones públicas, atención, datos de clientes y recomendaciones.
Riesgo crítico. Salud, finanzas, empleo, seguridad, justicia e infraestructura.
Los niveles superiores requieren fuentes controladas, menor autonomía, auditoría y revisión especializada.
Impacto actual
Los modelos de lenguaje se han convertido en componentes centrales de aplicaciones de productividad, búsqueda, programación, servicio, análisis y creación.
Su adopción ha reducido el costo de transformar texto no estructurado y producir un primer borrador.
El acceso mediante lenguaje natural permite que profesionales de distintas áreas utilicen capacidades que anteriormente requerían software especializado.
El volumen de contenido generado ha aumentado y ha desplazado el valor hacia la selección de problemas, calidad de datos, distribución, verificación y confianza.
Las empresas incorporan modelos mediante aplicaciones comerciales, API, soluciones locales y plataformas empresariales.
Los modelos pequeños ganan relevancia en tareas especializadas y entornos que necesitan privacidad o baja latencia.
La recuperación, las herramientas y los agentes amplían las capacidades del modelo, mientras aumentan la superficie de seguridad y la necesidad de gobernanza.
En marketing, los modelos facilitan analizar grandes cantidades de conversaciones y adaptar contenidos. Su ventaja sostenible depende de datos propios, conocimiento del mercado, identidad de marca, procesos y revisión editorial.
La capacidad para generar mensajes se ha convertido en un recurso ampliamente disponible. La diferenciación se concentra en el criterio, la evidencia, la experiencia y la relación con la audiencia.
Futuro y tendencias
Modelos multimodales. El lenguaje se integrará con visión, audio, video y acción.
Contextos más amplios. Los modelos procesarán documentos, proyectos y historiales mayores.
Recuperación más precisa. Las aplicaciones utilizarán fuentes estructuradas y actualizadas.
Modelos pequeños especializados. Crecerán los sistemas optimizados para tareas y dispositivos.
Ejecución local. Más modelos funcionarán en teléfonos, computadoras y servidores privados.
Agentes. Los modelos utilizarán herramientas y completarán procesos de varios pasos.
Memoria persistente. Las aplicaciones conservarán preferencias y decisiones bajo controles.
Razonamiento asistido. Se desarrollarán métodos para asignar mayor cómputo a problemas complejos.
Inferencia adaptativa. El sistema utilizará distintos recursos según la dificultad.
Arquitecturas híbridas. Atención, estado, recuperación y expertos se combinarán.
Modelos con herramientas verificables. Los cálculos y consultas se delegarán a sistemas especializados.
Procedencia. Las respuestas incorporarán fuentes y trazabilidad.
Evaluaciones continuas. Los modelos se probarán durante todo su ciclo de vida.
Gobernanza automatizada. Las plataformas aplicarán políticas según datos y riesgo.
Privacidad mejorada. La personalización buscará reducir transferencia de información.
Eficiencia energética. La optimización se convertirá en un criterio central.
Multilingüismo más equilibrado. Se desarrollarán corpus y tokenizaciones para lenguas de bajos recursos.
Datos sintéticos. Se utilizarán para entrenamiento, evaluación y simulación, con controles de calidad.
Interacción por voz. Los modelos funcionarán como interfaces continuas.
Software generado. La programación asistida ampliará la creación de aplicaciones.
Modelos incorporados. Muchas funciones utilizarán modelos sin mostrar una interfaz separada.
Regulación. Aumentarán requisitos de transparencia, seguridad y responsabilidad.
Revalorización del contenido humano. La experiencia directa y la autoría verificable adquirirán valor.
Curaduría. La abundancia de generación hará que seleccionar y verificar sea una competencia central.
Véase también
- Modelo de lenguaje de gran tamaño
- Modelo de lenguaje pequeño
- Procesamiento del lenguaje natural
- Lingüística computacional
- Inteligencia artificial
- Aprendizaje automático
- Aprendizaje profundo
- Inteligencia artificial generativa
- Modelo fundacional
- Transformer
- Atención
- Red neuronal recurrente
- LSTM
- Embedding
- Token
- Tokenización
- Ventana de contexto
- Modelo autoregresivo
- Modelo enmascarado de lenguaje
- Aprendizaje en contexto
- Zero-shot learning
- Few-shot learning
- Prompt
- Prompt engineering
- Ingeniería de contexto
- Fine-tuning
- RAG
- Agentes de inteligencia artificial
- Programación asistida por inteligencia artificial
- Vibe coding
- Desarrollo agéntico
- Alucinación de inteligencia artificial
- Prompt injection
- AI slop
- Gobernanza de inteligencia artificial
- Automatización
- Automatización de marketing
- Marketing conversacional
- AEO
- GEO
- Marketing digital
- Marketing de contenidos
- Ciberseguridad
Referencias
- Shannon, Claude E. A Mathematical Theory of Communication. Bell System Technical Journal, 1948.
- Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal; Jauvin, Christian. A Neural Probabilistic Language Model. Journal of Machine Learning Research, 2003.
- Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey. Efficient Estimation of Word Representations in Vector Space. arXiv, 2013.
- Mikolov, Tomas et al. Distributed Representations of Words and Phrases and Their Compositionality. arXiv, 2013.
- Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. Sequence to Sequence Learning with Neural Networks. arXiv, 2014.
- Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua. Neural Machine Translation by Jointly Learning to Align and Translate. arXiv, 2014.
- Vaswani, Ashish et al. Attention Is All You Need. arXiv, 2017.
- Peters, Matthew E. et al. Deep Contextualized Word Representations. arXiv, 2018.
- Radford, Alec et al. Improving Language Understanding by Generative Pre-Training. OpenAI, 2018.
- Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv, 2018.
- Radford, Alec et al. Language Models Are Unsupervised Multitask Learners. OpenAI, 2019.
- Yang, Zhilin et al. XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv, 2019.
- Raffel, Colin et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv, 2019.
- Lewis, Mike et al. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. arXiv, 2019.
- Kaplan, Jared et al. Scaling Laws for Neural Language Models. arXiv, 2020.
- Brown, Tom B. et al. Language Models Are Few-Shot Learners. arXiv, 2020.
- Lewis, Patrick et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv, 2020.
- Hoffmann, Jordan et al. Training Compute-Optimal Large Language Models. arXiv, 2022.
- Zhao, Wayne Xin et al. A Survey of Large Language Models. arXiv, 2023.
- Minaee, Shervin et al. Large Language Models: A Survey. arXiv, 2024.
- Jing, Kun; Xu, Jungang. A Survey on Neural Network Language Models. arXiv, 2019.
- Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. FAccT, 2021.
- Scao, Teven Le et al. BLOOM: A 176B-Parameter Open-Access Multilingual Language Model. arXiv, 2022.
- Kudo, Taku; Richardson, John. SentencePiece: A Simple and Language Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv, 2018.
- Huang, Lei et al. A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv, 2023.
- NIST. Artificial Intelligence Risk Management Framework.
- NIST. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile.
- OWASP GenAI Security Project. OWASP Top 10 for LLM and Generative AI Applications.
Bibliografía
- Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua. Neural Machine Translation by Jointly Learning to Align and Translate. 2014.
- Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. FAccT, 2021.
- Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal; Jauvin, Christian. A Neural Probabilistic Language Model. Journal of Machine Learning Research, 2003.
- Brown, Tom B. et al. Language Models Are Few-Shot Learners. Advances in Neural Information Processing Systems, 2020.
- Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT, 2019.
- Hoffmann, Jordan et al. Training Compute-Optimal Large Language Models. 2022.
- Jurafsky, Daniel; Martin, James H. Speech and Language Processing.
- Kaplan, Jared et al. Scaling Laws for Neural Language Models. 2020.
- Lewis, Mike et al. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. 2019.
- Lewis, Patrick et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020.
- Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey. Efficient Estimation of Word Representations in Vector Space. 2013.
- Peters, Matthew E. et al. Deep Contextualized Word Representations. NAACL, 2018.
- Radford, Alec et al. Improving Language Understanding by Generative Pre-Training. OpenAI, 2018.
- Raffel, Colin et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. Journal of Machine Learning Research, 2020.
- Shannon, Claude E. A Mathematical Theory of Communication. Bell System Technical Journal, 1948.
- Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. Sequence to Sequence Learning with Neural Networks. 2014.
- Vaswani, Ashish et al. Attention Is All You Need. Advances in Neural Information Processing Systems, 2017.
- Zhao, Wayne Xin et al. A Survey of Large Language Models. arXiv, 2023.
- Inteligencia artificial
- Modelos de lenguaje
- Procesamiento del lenguaje natural
- Lingüística computacional
- Aprendizaje automático
- Aprendizaje profundo
- Inteligencia artificial generativa
- Transformers
- Agentes de inteligencia artificial
- Automatización
- Marketing digital
- Marketing de contenidos
- Marketing conversacional
- Ciberseguridad
- Gobernanza de inteligencia artificial
- Tecnología
- Innovación