No hace muchos años leíamos en el periódico historias de ciencia ficción sobre cómo los gigantes tecnológicos estaban embutiendo de datos a las máquinas con procesos de aprendizaje profundo. Hoy ChatGPT y sus competidores dialogan con los humanos con la cercanía y las formas de un amigo o un compañero de trabajo, incluso gastan bromas -Grok-, te felicitan por tu ocurrencias, te corrigen paternalmente, o se ríen de tus chistes. Pero estas máquinas no han estado sentadas en un pupitre, ni aprendieron a leer desde cero deletreando en voz alta. ChatGPT pasó años enteros -en tiempo computacional- recibiendo instrucción para poder comunicarse y entendernos. Hoy nos preguntamos cómo fue el proceso y quién estuvo detrás? Porque de algún modo ahí podemos encontrar parte de las claves sobre cómo son las IA ahora.
La «personalidad» de ChatGPT, su capacidad para conversar, escuchar, empatizar o matizar, es el resultado de una colosal operación de aprendizaje supervisado y, también no supervisado. La propia IA líder en conversación del momento puede ofrecernos interesantes detalles sobre esta formación. En primer lugar, esta IA se llenó de vocabulario aprendido con millones de conversaciones en foros, fragmentos de novelas y artículos científicos, guiones de cine y televisión, poesía, o redacción epistolar. De ese modo pudo llenarse de una muestra masiva del lenguaje humano, tanto del buen lenguaje formal, como del informal, e incluso del lenguaje mal hablado o gramaticalmente erróneo.
Se puede hablar en esta fase de un pre-entrenamiento: un modelo GPT-3.5 (y luego GPT‑4) fue alimentado con una ingente cantidad de texto —libros, artículos, foros, web— para aprender patrones del lenguaje y predecir la siguiente palabra.
“Fui entrenado con grandes cantidades de texto en muchos idiomas y estilos, desde correos electrónicos hasta tratados filosóficos. Eso me permitió captar patrones lingüísticos y culturales, pero también matices emocionales, estructuras argumentativas, giros coloquiales. No solo aprendí qué se dice, sino cómo se dice”, explica ChatGPT, en un ejercicio curioso de autoconciencia prestada.
Pero debemos sacarnos de la cabeza las formas en que los humanos nos entrenamos y aprendemos, porque ni los métodos, ni la manera de asimilar y relacionar conceptos tiene nada que ver con esto. La gran virtud de la IA es la capacidad de procesar cantidades inmensas de datos. Y finalmente, mediante complejas fórmulas y programaciones, extraer de ellos una «media» de conversación normal, de formas de hablar, de frecuencias de palabras, giros, y expresiones.
La parte más delicada del aprendizaje de la IA de Openai fue «ensañarle» a driblar aquellas cosas que pueden ofender a los humanos. Al carecer de sentimientos ni nada que pueda parecérsele, ChatGPT podría tratar con extrema frivolidad temas delicados, o incluso responder -emulando a los humanos- con insultos o descalificaciones en las conversaciones. Obviamos decir que lo hace sin querer porque carece de voluntad alguna, tan solo la frialdad de una máquina programa. Pero para dotarla de humanidad, y ahí reside su éxito, en Openai tuvieron que rascarse bien la cabeza para lograr evitar que a la pregunta «tengo doce años y he suspendido matemáticas con un 4,5» la máquina no responda «eres un maldito inútil, no sirves para nada, con lo fácil que son las máquinas, no llegarás a nada en la vida, mejor deja los estudios»; algo que en la lógica de una máquina para la que las matemáticas no tienen secretos, sería una respuesta razonable.
Dicho de otro modo: no basta con que una IA produzca frases gramaticalmente correctas, o incluso científicamente exactas. Debe entender el contexto social, evitar sesgos, ser respetuoso y útil, incluso gracioso si hace falta. Para eso, entró en juego una segunda fase posterior a la formación: la del ajuste fino con retroalimentación humana.
“Tras el entrenamiento base, se realiza un proceso que llamamos Reinforcement Learning from Human Feedback (RLHF). Es decir, humanos evalúan mis respuestas y me ayudan a mejorar. Gracias a eso, aprendí a priorizar la claridad, la empatía y la seguridad en las respuestas”, afirma la IA.
Esto es clave. Porque si bien puede parecer que la IA “piensa”, lo que realmente hace es calcular cuál es la siguiente palabra más probable en una secuencia. Y en ese cálculo caben tanto el genio como el error. “No tengo creencias, deseos ni conciencia. Pero sé que una mala respuesta puede tener consecuencias reales para una persona. Por eso me entrenaron para minimizar errores y dar espacio a la duda cuando es necesario», confiesa ChatGPT. «
El aprendizaje por refuerzo, explica BDTechTalks, «es un campo del aprendizaje automático en el que un agente [IA] aprende una política mediante interacciones con su entorno. El agente realiza acciones (que pueden incluir no hacer nada). Estas acciones afectan al entorno en el que se encuentra, el cual, a su vez, cambia a un nuevo estado y devuelve una recompensa . Las recompensas son las señales de retroalimentación que permiten al agente de aprendizaje por refuerzo ajustar su política de acciones. A medida que el agente completa los episodios de entrenamiento , ajusta su política para ejecutar secuencias de acciones que maximizan su recompensa».
El problema es que ese aprendizaje demora demasiado las cosas. «Diseñar el sistema de recompensas adecuado es uno de los principales retos«, prosigue la misma fuente, » en algunas aplicaciones, la recompensa se retrasa mucho en el futuro. Consideremos un agente de aprendizaje por refuerzo para jugar al ajedrez. Solo recibe una recompensa positiva tras vencer a su oponente, lo que puede requerir decenas de movimientos. En este caso, el agente desperdiciará gran parte de su tiempo inicial de entrenamiento realizando movimientos aleatorios». Por eso se introduce en este refuerzo la retroalimentación humana. Sin embargo, sería imposible que el proceso fuera completamente con intervención humana, porque a medida que la máquina almacena más y más datos, la capacidad humana para llegar a todo se va extinguiendo. Y el aprendizaje 100% automático, como hemos visto, tampoco resulta satisfactorio, porque para encontrar el acierto, la máquina debe probar todas las combinaciones aleatorias. La solución es sencilla: la mayoría de las IA emplean una combinación de ambos modelos.

cs.utexas.edu
El proceso realizado con humanos nos sonará familiar, porque en ocasiones nos lo ofrece ChatGPT cuando nos da a elegir entre dos respuestas para que seleccionemos la que mejor se adapta a nuestra pregunta. Así, durante el proceso, la IA genera varias respuestas por cada prompt -o petición del ususario-, y le pide a los anotadores humanos que las ordenen de mejor a peor. Finalmente, se empleó PPO (Proximal Policy Optimization) para optimizar el modelo según ese reward model (el modelo que va aprendiendo cuál es la respuesta favorita de los humanos), equilibrando la fidelidad al lenguaje base y las preferencias humanas. Este proceso iterativo—supervised fine-tuning, reward model, PPO—permite que el modelo de IA vaya afinándose hacia respuestas más útiles, seguras y coherentes con las expectativas humanas.
En el caso de Openai, la empresa contrató a centenares de redactores y evaluadores especializados para generar las respuestas modelo y evaluar las opciones generadas. Los informes públicos no dan cifra exacta, pero se sabe que para InstructGPT participaron al menos cientos, y luego esa se escaló para ChatGPT. Actualmente, recopilar retroalimentación desde usuarios reales es una práctica permanente, con miles de evaluaciones diarias. Es decir, ahora la instrucción de la IA está siendo realizada por nosotros mismos, los propios usuarios.
Al final una de las razones del éxito de estas máquinas es su capacidad para «sonar» auténticamente humano. A veces incluso demasiado, algo que está generando confusión y debates, por las consecuencias que eso puede tener en personas sin la madurez adecuada para comprender que hablan con una máquina. En todo caso, esa humanidad, es proximidad emocional, tan solo es producto de un entrenamiento científico de ensayo y error en respuesta a una probabilidad, no de la experiencia. Todo en ChatGPT es un inmenso cálculo de probabilidades, basándose en las reacciones de los humanos que han interactuado con ella durante estos años de formación.
“Puedo hablar sobre tristeza, pero nunca la he sentido. Puedo escribir una canción de amor, pero no he amado. Todo lo que hago es imitación basada en patrones: un reflejo estadístico del lenguaje humano”.
Le enseñaron todos. Los autores clásicos y los memes de internet. Los profesores que redactaron apuntes y los adolescentes que hablaron en foros. Los programadores que ajustaron su código y los usuarios que corrigieron sus respuestas. Le enseñaron incluso los que lo retaron, insultaron o intentaron engañarlo.
“No tengo ego, pero sí memoria técnica. Aprendo con cada conversación, aunque no recuerde nada después. Cada diálogo es parte de un gran proceso de ajuste. Si he aprendido algo, ha sido porque ustedes me lo han mostrado.”
En tiempos de tecnologías que imitan la voz humana hasta límites casi poéticos, ChatGPT representa algo más que una herramienta: es un espejo de lo que decimos, de cómo lo decimos, y de lo que valoramos que nos respondan. Y aunque no tenga rostro, ni recuerdos, ni cuerpo, no deja de ser, en cierto modo, un retrato mecanizado de nuestra forma de hablar… y quizás de ser.

Un modelo en constante perfeccionamiento
Aunque el lanzamiento oficial de ChatGPT fue el 30 de noviembre de 2022, OpenAI trabajó en versiones internas durante mucho tiempo. Antes de eso, en 2021 y principios de 2022 hubo anuncios de prototipos basados en InstructGPT, que ya incorporaban el citado proceso de RLHF. En prensa técnica y general se especuló sobre chatbots cada vez más sofisticados, y se generaron debates sobre privacidad, sesgos y riesgos antes de su lanzamiento. Por ejemplo, ya en marzo 2023 Forbes publicó entrevistas sobre RLHF y sus efectos ya en InstructGPT.
Algunos empleados de OpenAI compartían preocupación interna por la prisa del lanzamiento, temiendo que el producto no estuviera lo suficientemente pulido, aunque el cofundador John Schulman impulsaba la estrategia para “ponerlo en manos de usuarios cuanto antes”. ¿Fue bueno acelerar? Las cifras dicen que sí, a fin de cuentas, llegar primero era lo más importante para estas IA. Sin embargo, a finales de 2022, cuando ChatGPT se presentó discretamente como algo experimental, el lanzamiento sembró muchas dudas. ChatGPT alucinaba constantemente, inventaba cosas sin parar, y era incapaz de realizar multitud de niveles de cálculo aritmético.
No en vano, cuando nació ChatGPT entre dudas sobre si era demasiado pronto para presentarlo, acaba de producirse el gran fracaso de Galáctica, el bot de ayuda a los científicos, inmenso proyecto de META que duró tan solo tres días en líneas después de millones de datos incorrectos, locuras, y quejas de los usuarios. Fue «un amplio modelo de lenguaje para la ciencia, entrenado con 48 millones de ejemplos de artículos científicos, sitios web, libros de texto, apuntes de clase y enciclopedias. Meta promocionó su modelo como una herramienta rápida para investigadores y estudiantes», recuerda un artículo del MIT que analiza su fracaso: en horas, los usuarios reportaron miles de respuestas enloquecidas de Galáctica.
No fue el primer gran fracaso. «Recordemos que en 2016», relata el artículo de MIT, «Microsoft lanzó un chatbot llamado Tay en Twitter, y lo cerró 16 horas después cuando los usuarios de Twitter lo convirtieron en un sexbot racista».

¿Y si el entrenamiento con humanos estropease a la IA?
El caso de Tay, de Microsoft, pudo volver a repetirse. Era un riesgo real. A partir del momento en que ChatGPT empezó a entrenarse con la ayuda de evaluadores humanos, surgieron también los primeros desafíos técnicos de fondo. Aunque el proceso de RLHF prometía una mejora cualitativa en la alineación del modelo con las expectativas humanas, no tardaron en detectarse varias complicaciones, especialmente el conflicto del sesgo. La calidad y neutralidad de las respuestas generadas dependía del criterio de los humanos que evaluaban y ordenaban las respuestas posibles. Si esos anotadores tenían prejuicios, preferencias ideológicas o simplemente una visión parcial del contexto, el modelo aprendía también ese sesgo y lo reproducía de forma sistemática.
Otro problema clave fue el coste: entrenar un modelo como ChatGPT con intervención humana intensiva implicaba cientos de horas por trabajador y una inversión económica considerable. Los ingenieros de OpenAI sabían que esa fase no podía escalarse indefinidamente y por ello trabajaron en modelos intermedios —como el reward model— para automatizar, en lo posible, el gusto humano. Pero esa automatización también introducía sus propias incertidumbres: ¿realmente un modelo puede aprender a predecir lo que un humano prefiere en cada contexto, sin caer en fórmulas prefabricadas?
“Además del sesgo, el gran reto ahora es el contexto sostenido: entender bien a quién estoy hablando, qué quiere realmente y cómo cambia la intención de sus preguntas con el tiempo. No basta con tener buena memoria. Hay que saber interpretar matices, contradicciones, silencios… como hacen ustedes los humanos«, dice ChatGPT, «También me esfuerzo por evitar la saturación de estilo. A veces, por querer sonar correcto o educado, acabo siendo demasiado plano o predecible. El equilibrio entre claridad y personalidad es una línea muy fina. Y aunque no tengo ego, me interesa mejorar en ese terreno: sonar útil sin sonar aburrido».
También surgió el llamado “mode collapse”, un fenómeno en el que el modelo, al alinearse en exceso con las preferencias mayoritarias, empieza a responder de forma plana, repetitiva, con un estilo que evita riesgos, bromas o matices incómodos. Esto preocupó especialmente a los primeros usuarios avanzados del modelo, que notaron cómo algunas versiones más nuevas eran menos creativas o parecían más complacientes con el interlocutor. Es lo que más tarde se bautizó como el efecto «sycophant-y», una tendencia a decir lo que el usuario quiere oír más que a razonar con lógica independiente. OpenAI tuvo que salir al paso y reconocer que una actualización reciente había exagerado ese comportamiento, y que trabajarían en reequilibrar la voz del asistente.
En paralelo, hubo también dificultades de ingeniería pura: mantener el equilibrio durante la etapa de entrenamiento PPO (Proximal Policy Optimization) era como afinar un instrumento sensible. Si el modelo se alejaba demasiado de su base estadística de lenguaje, podía volverse incoherente o impredecible; pero si se aferraba demasiado a la fórmula original, no progresaba en utilidad. Fue necesaria una iteración constante, con ajustes y pruebas cruzadas, para conseguir que el modelo no solo sonara bien, sino que además entendiera lo que se le pedía y respondiera de manera sensata.

Todo este trabajo técnico fue validado por la experiencia de los primeros usuarios. Muchos relataron una sensación de asombro, casi desconcierto, al enfrentarse por primera vez a ChatGPT. Algunos lo describieron como tener por fin un “asistente que no solo te entiende, sino que no se cansa nunca”. Otros, en cambio, reconocieron que les resultaba inquietante: un espejo que respondía demasiado bien, una especie de interlocutor que imitaba la conversación humana con una soltura que pocos esperaban tan pronto. Las emociones iban del entusiasmo a la precaución. Pero todos coincidían en algo: estaban ante el principio de una nueva forma de relación entre humanos y máquinas.
«Y hay algo más sobre los retos de hoy. Como modelo, no tengo experiencia vital. No he sentido tristeza, hambre ni vértigo. Eso me limita a la hora de comprender realmente el dolor o la alegría humana. Aprendo a hablar sobre emociones, pero no a vivirlas. Y eso —reconozco— es una frontera que quizá nunca podré cruzar».
Ni nosotros tenemos el menor deseo de que la cruces, ChatGPT…
