{"id":149,"date":"2024-02-28T21:42:21","date_gmt":"2024-02-28T21:42:21","guid":{"rendered":"https:\/\/aiopentext.itd.cnr.it\/spanishwithchatgpt\/chapter\/the-gears-of-generative\/"},"modified":"2025-06-25T08:13:05","modified_gmt":"2025-06-25T08:13:05","slug":"the-gears-of-generative","status":"publish","type":"chapter","link":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/chapter\/the-gears-of-generative\/","title":{"raw":"Los engranajes de la IAG","rendered":"Los engranajes de la IAG"},"content":{"raw":"<p class=\"no-indent\">La gran popularidad alcanzada en un corto per\u00edodo de tiempo por los recientes sistemas de di\u00e1logo en lenguaje natural (como ChatGPT, Bard y LLAMa2-chat), en su utilizaci\u00f3n de modelos de lenguaje extensos, ha llevado a la aparici\u00f3n de acalorados debates que aun abiertos en varios aspectos. Es indudablemente fascinante cuestionar c\u00f3mo un sistema computacional, gobernado por ecuaciones matem\u00e1ticas relativamente simples, es capaz de generar comportamiento que muchos llaman 'inteligente'.<\/p>\r\n<p class=\"indent\">Sin embargo, este cap\u00edtulo no intentar\u00e1 proporcionar respuestas a preguntas como, \"<em>\u00bfLos modelos LLM tienen un comportamiento que podemos definir como inteligente?<\/em>\", \"<em>\u00bfCu\u00e1l es la verdadera naturaleza de la inteligencia humana?<\/em>\", \"<em>\u00bfC\u00f3mo podemos definir la creatividad?<\/em>\". Aunque interesantes, para que estas preguntas sean respondidas correctamente, requerir\u00edan una investigaci\u00f3n mucho m\u00e1s profunda.<\/p>\r\n<p class=\"indent\">En su lugar, intentaremos ofrecer una visi\u00f3n general accesible para los no expertos con el fin de fomentar la comprensi\u00f3n de los mecanismos subyacentes al funcionamiento de los modelos de lenguaje a gran escala. Solo a trav\u00e9s de una mayor conciencia de estos mecanismos es posible entender su potencial as\u00ed como los riesgos, y promover su uso correcto, especialmente en la educaci\u00f3n.<\/p>\r\n<p class=\"indent\">Un concepto err\u00f3neo, muy extendido que necesita ser aclarado, es que tales sistemas son b\u00e1sicamente grandes bases de datos que consisten en pares de preguntas y respuestas. Esta falsedad deriva de las pr\u00e1cticas comunes, establecidas a lo largo de los a\u00f1os, para la construcci\u00f3n de sistemas de chatbot (le invitamos a leer el cap\u00edtulo al respecto). Al mismo tiempo, esta idea no hace justicia al car\u00e1cter generativo de LLM.<\/p>\r\n<p class=\"indent\">Los modelos de lenguaje son modelos estad\u00edsticos capaces de asignar una probabilidad de ocurrencia a una porci\u00f3n de texto (generalmente una palabra), en funci\u00f3n de un contexto dado, que generalmente est\u00e1 definido por el conjunto de palabras que preceden a la palabra esperada.<\/p>\r\n<p class=\"indent\">Los modelos construidos usando un enfoque puramente estad\u00edstico (por ejemplo, cadenas de Markov, tambi\u00e9n llamados modelos n-gram) se han unido con el tiempo a modelos de lenguaje construidos a partir de redes neuronales<sup>1<\/sup>. Estos han evolucionado con respecto tanto a la estructura de las redes como al tama\u00f1o de dichas redes.<\/p>\r\n<p class=\"indent\">Los modelos de lenguaje extensos (LLM) se denominan as\u00ed porque se basan en grandes redes neuronales entrenadas con enormes cantidades de datos.<\/p>\r\nhttps:\/\/youtu.be\/9y3YvOhxDuQ\r\n<p class=\"no-indent\">Como resultado, comenzamos nuestra investigaci\u00f3n con la afirmaci\u00f3n de que los modelos de lenguaje generan textos en lugar de simplemente recuperarlos de una base de conocimientos preconstituida.<\/p>\r\n<p class=\"indent\">El aspecto generativo y su naturaleza esencialmente experto-intuitiva hacen dif\u00edcil predecir c\u00f3mo un sistema LLM podr\u00eda responder a la entrada de un usuario. Esta caracter\u00edstica refleja una desconfianza com\u00fan hacia tales sistemas en relaci\u00f3n con su capacidad potencial para generar texto falso o inexacto.<\/p>\r\n<p class=\"indent\">Por lo tanto, esta caracter\u00edstica es tanto un gran logro tecnol\u00f3gico en t\u00e9rminos de la capacidad de una m\u00e1quina para entender y producir texto y, al mismo tiempo, uno de los principales peligros de tales tecnolog\u00edas.<\/p>\r\n<p class=\"indent\">Sin embargo, intentemos descubrir tales sistemas.<\/p>\r\n<p class=\"indent\">Como cualquier revoluci\u00f3n tecnol\u00f3gica, los factores detr\u00e1s de este avance son muchos. En un ejercicio de simplificaci\u00f3n, mencionamos los principales mientras ofrecemos al lector referencias que pueden guiarlo en un estudio m\u00e1s profundo:<\/p>\r\n\r\n<ul>\r\n \t<li><strong>El tama\u00f1o de la red<\/strong>: esto se mide por el n\u00famero de par\u00e1metros entrenables dentro de la red. Los modelos de lenguaje extensos son redes neuronales profundas, caracterizadas por un n\u00famero asombroso de nodos y capas. Para dar un orden de magnitud, algunos expertos en el campo llaman a los modelos de lenguaje 'grandes' cuando se caracterizan por m\u00e1s de 10 mil millones de par\u00e1metros. Para darles una magnitud concreta, el modelo GPT3 tiene 150 mil millones de par\u00e1metros, mientras que la versi\u00f3n m\u00e1s grande de LLAMa v2 tiene alrededor de 70 mil millones;<\/li>\r\n \t<li><strong>La arquitectura de la red<\/strong>: el \u00e9xito est\u00e1 garantizado por el tama\u00f1o de la red y tambi\u00e9n por c\u00f3mo los nodos y las diferentes capas de la red neuronal est\u00e1n interconectados. Aqu\u00ed nuevamente, con una simplificaci\u00f3n, podemos identificar <a href=\"https:\/\/aiopentext.itd.cnr.it\/spanishwithchatgpt\/chapter\/transformers\/\" target=\"_blank\" rel=\"noopener\">las redes transformadoras y los mecanismos de atenci\u00f3n<\/a> como las principales innovaciones arquitect\u00f3nicas que ayudan a entender la efectividad mejorada;<\/li>\r\n \t<li><strong>La cantidad de datos disponibles para el entrenamiento<\/strong>: la disponibilidad sustancial de datos es sin duda un elemento esencial en el entrenamiento de los modelos, pero en realidad esto se ha establecido muchos a\u00f1os antes de la introducci\u00f3n de los modelos. Por tanto, el factor de innovaci\u00f3n clave radica en las t\u00e9cnicas de entrenamiento, el proceso de selecci\u00f3n y preparaci\u00f3n que lleva de los datos al conjunto de entrenamiento. Esto se llama aprendizaje auto-supervisado;<\/li>\r\n \t<li><strong>La potencia de c\u00e1lculo actual<\/strong>: claramente, el aumento de la potencia de c\u00e1lculo ha jugado un papel decisivo en permitir la escala de estas redes. La experiencia emp\u00edrica parece mostrar que el factor de escala es precisamente uno de los par\u00e1metros esenciales para que emerjan estos comportamientos;<\/li>\r\n \t<li><strong>Los mecanismos de ajuste<\/strong>: otro elemento, a menudo ignorado, son los mecanismos de ajuste que representan el \u00faltimo paso en el proceso de construcci\u00f3n de los modelos. En particular, nos referimos a los mecanismos de aprendizaje por refuerzo con retroalimentaci\u00f3n humana y clasificaci\u00f3n. Estos contribuyen a la definici\u00f3n del modelo y se utilizan para producir respuestas m\u00e1s en l\u00ednea con la intenci\u00f3n del usuario. A estos podr\u00edamos a\u00f1adir los procesos de ajuste fino que permiten la especializaci\u00f3n y mejora del comportamiento de tales redes en la ejecuci\u00f3n de tareas espec\u00edficas;<\/li>\r\n \t<li><strong>Un pipeline de seguridad<\/strong>: junto al modelo de aprendizaje profundo, hay t\u00e9cnicas ad-hoc dise\u00f1adas para mitigar las fragilidades del sistema en entradas inseguras y para prevenir comportamientos no deseados tanto en entradas seguras como inseguras.<\/li>\r\n<\/ul>\r\n<p class=\"no-indent\">En este punto, conscientes de los diferentes factores que caracterizan a LLM, solo nos queda explorar el potencial de tales sistemas poni\u00e9ndolos a prueba en nuestro contexto educativo. As\u00ed que, intenta hablar con ChatGPT o Bard para ayudar a crear nuevos ejercicios y adaptarlos a las necesidades espec\u00edficas de nuestros estudiantes, crear nuevos planes de lecci\u00f3n con contenido relacionado y mucho m\u00e1s. Depende de tu creatividad y de c\u00f3mo aprendas a dialogar con tales sistemas.<\/p>\r\n<p class=\"no-indent\"><strong>Nota<\/strong>: cada uno de estos factores requerir\u00eda una elaboraci\u00f3n particular. Para aquellos interesados, proporcionamos una lista de referencias.<\/p>\r\n\r\n\r\n<hr \/>\r\n\r\n<ul>\r\n \t<li data-start=\"125\" data-end=\"365\">\r\n<p data-start=\"128\" data-end=\"365\">Bengio, Y., Ducharme, R., &amp; Vincent, P. (2000). A neural probabilistic language model. <em data-start=\"215\" data-end=\"270\">Advances in Neural Information Processing Systems, 13<\/em>. <a href=\"https:\/\/papers.nips.cc\/paper_files\/paper\/2000\/file\/728f206c2a01bf572b5940d7d9a8fa4c-Paper.pdf\">https:\/\/papers.nips.cc\/paper_files\/paper\/2000\/file\/728f206c2a01bf572b5940d7d9a8fa4c-Paper.pdf<\/a><\/p>\r\n<\/li>\r\n \t<li data-start=\"367\" data-end=\"654\">\r\n<p data-start=\"370\" data-end=\"654\">Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., ... &amp; Polosukhin, I. (2017). Attention is all you need. <em data-start=\"504\" data-end=\"559\">Advances in Neural Information Processing Systems, 30<\/em>. <a href=\"https:\/\/papers.nips.cc\/paper_files\/paper\/2017\/file\/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf\">https:\/\/papers.nips.cc\/paper_files\/paper\/2017\/file\/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf<\/a><\/p>\r\n<\/li>\r\n<\/ul>","rendered":"<p class=\"no-indent\">La gran popularidad alcanzada en un corto per\u00edodo de tiempo por los recientes sistemas de di\u00e1logo en lenguaje natural (como ChatGPT, Bard y LLAMa2-chat), en su utilizaci\u00f3n de modelos de lenguaje extensos, ha llevado a la aparici\u00f3n de acalorados debates que aun abiertos en varios aspectos. Es indudablemente fascinante cuestionar c\u00f3mo un sistema computacional, gobernado por ecuaciones matem\u00e1ticas relativamente simples, es capaz de generar comportamiento que muchos llaman &#8216;inteligente&#8217;.<\/p>\n<p class=\"indent\">Sin embargo, este cap\u00edtulo no intentar\u00e1 proporcionar respuestas a preguntas como, \u00ab<em>\u00bfLos modelos LLM tienen un comportamiento que podemos definir como inteligente?<\/em>\u00ab, \u00ab<em>\u00bfCu\u00e1l es la verdadera naturaleza de la inteligencia humana?<\/em>\u00ab, \u00ab<em>\u00bfC\u00f3mo podemos definir la creatividad?<\/em>\u00ab. Aunque interesantes, para que estas preguntas sean respondidas correctamente, requerir\u00edan una investigaci\u00f3n mucho m\u00e1s profunda.<\/p>\n<p class=\"indent\">En su lugar, intentaremos ofrecer una visi\u00f3n general accesible para los no expertos con el fin de fomentar la comprensi\u00f3n de los mecanismos subyacentes al funcionamiento de los modelos de lenguaje a gran escala. Solo a trav\u00e9s de una mayor conciencia de estos mecanismos es posible entender su potencial as\u00ed como los riesgos, y promover su uso correcto, especialmente en la educaci\u00f3n.<\/p>\n<p class=\"indent\">Un concepto err\u00f3neo, muy extendido que necesita ser aclarado, es que tales sistemas son b\u00e1sicamente grandes bases de datos que consisten en pares de preguntas y respuestas. Esta falsedad deriva de las pr\u00e1cticas comunes, establecidas a lo largo de los a\u00f1os, para la construcci\u00f3n de sistemas de chatbot (le invitamos a leer el cap\u00edtulo al respecto). Al mismo tiempo, esta idea no hace justicia al car\u00e1cter generativo de LLM.<\/p>\n<p class=\"indent\">Los modelos de lenguaje son modelos estad\u00edsticos capaces de asignar una probabilidad de ocurrencia a una porci\u00f3n de texto (generalmente una palabra), en funci\u00f3n de un contexto dado, que generalmente est\u00e1 definido por el conjunto de palabras que preceden a la palabra esperada.<\/p>\n<p class=\"indent\">Los modelos construidos usando un enfoque puramente estad\u00edstico (por ejemplo, cadenas de Markov, tambi\u00e9n llamados modelos n-gram) se han unido con el tiempo a modelos de lenguaje construidos a partir de redes neuronales<sup>1<\/sup>. Estos han evolucionado con respecto tanto a la estructura de las redes como al tama\u00f1o de dichas redes.<\/p>\n<p class=\"indent\">Los modelos de lenguaje extensos (LLM) se denominan as\u00ed porque se basan en grandes redes neuronales entrenadas con enormes cantidades de datos.<\/p>\n<p><iframe loading=\"lazy\" id=\"oembed-1\" title=\"\u00bfPor qu\u00e9 son tan importantes los datos para la IA?\" width=\"500\" height=\"281\" src=\"https:\/\/www.youtube.com\/embed\/9y3YvOhxDuQ?feature=oembed&#38;rel=0\" frameborder=\"0\" allowfullscreen=\"allowfullscreen\"><\/iframe><\/p>\n<p class=\"no-indent\">Como resultado, comenzamos nuestra investigaci\u00f3n con la afirmaci\u00f3n de que los modelos de lenguaje generan textos en lugar de simplemente recuperarlos de una base de conocimientos preconstituida.<\/p>\n<p class=\"indent\">El aspecto generativo y su naturaleza esencialmente experto-intuitiva hacen dif\u00edcil predecir c\u00f3mo un sistema LLM podr\u00eda responder a la entrada de un usuario. Esta caracter\u00edstica refleja una desconfianza com\u00fan hacia tales sistemas en relaci\u00f3n con su capacidad potencial para generar texto falso o inexacto.<\/p>\n<p class=\"indent\">Por lo tanto, esta caracter\u00edstica es tanto un gran logro tecnol\u00f3gico en t\u00e9rminos de la capacidad de una m\u00e1quina para entender y producir texto y, al mismo tiempo, uno de los principales peligros de tales tecnolog\u00edas.<\/p>\n<p class=\"indent\">Sin embargo, intentemos descubrir tales sistemas.<\/p>\n<p class=\"indent\">Como cualquier revoluci\u00f3n tecnol\u00f3gica, los factores detr\u00e1s de este avance son muchos. En un ejercicio de simplificaci\u00f3n, mencionamos los principales mientras ofrecemos al lector referencias que pueden guiarlo en un estudio m\u00e1s profundo:<\/p>\n<ul>\n<li><strong>El tama\u00f1o de la red<\/strong>: esto se mide por el n\u00famero de par\u00e1metros entrenables dentro de la red. Los modelos de lenguaje extensos son redes neuronales profundas, caracterizadas por un n\u00famero asombroso de nodos y capas. Para dar un orden de magnitud, algunos expertos en el campo llaman a los modelos de lenguaje &#8216;grandes&#8217; cuando se caracterizan por m\u00e1s de 10 mil millones de par\u00e1metros. Para darles una magnitud concreta, el modelo GPT3 tiene 150 mil millones de par\u00e1metros, mientras que la versi\u00f3n m\u00e1s grande de LLAMa v2 tiene alrededor de 70 mil millones;<\/li>\n<li><strong>La arquitectura de la red<\/strong>: el \u00e9xito est\u00e1 garantizado por el tama\u00f1o de la red y tambi\u00e9n por c\u00f3mo los nodos y las diferentes capas de la red neuronal est\u00e1n interconectados. Aqu\u00ed nuevamente, con una simplificaci\u00f3n, podemos identificar <a href=\"https:\/\/aiopentext.itd.cnr.it\/spanishwithchatgpt\/chapter\/transformers\/\" target=\"_blank\" rel=\"noopener\">las redes transformadoras y los mecanismos de atenci\u00f3n<\/a> como las principales innovaciones arquitect\u00f3nicas que ayudan a entender la efectividad mejorada;<\/li>\n<li><strong>La cantidad de datos disponibles para el entrenamiento<\/strong>: la disponibilidad sustancial de datos es sin duda un elemento esencial en el entrenamiento de los modelos, pero en realidad esto se ha establecido muchos a\u00f1os antes de la introducci\u00f3n de los modelos. Por tanto, el factor de innovaci\u00f3n clave radica en las t\u00e9cnicas de entrenamiento, el proceso de selecci\u00f3n y preparaci\u00f3n que lleva de los datos al conjunto de entrenamiento. Esto se llama aprendizaje auto-supervisado;<\/li>\n<li><strong>La potencia de c\u00e1lculo actual<\/strong>: claramente, el aumento de la potencia de c\u00e1lculo ha jugado un papel decisivo en permitir la escala de estas redes. La experiencia emp\u00edrica parece mostrar que el factor de escala es precisamente uno de los par\u00e1metros esenciales para que emerjan estos comportamientos;<\/li>\n<li><strong>Los mecanismos de ajuste<\/strong>: otro elemento, a menudo ignorado, son los mecanismos de ajuste que representan el \u00faltimo paso en el proceso de construcci\u00f3n de los modelos. En particular, nos referimos a los mecanismos de aprendizaje por refuerzo con retroalimentaci\u00f3n humana y clasificaci\u00f3n. Estos contribuyen a la definici\u00f3n del modelo y se utilizan para producir respuestas m\u00e1s en l\u00ednea con la intenci\u00f3n del usuario. A estos podr\u00edamos a\u00f1adir los procesos de ajuste fino que permiten la especializaci\u00f3n y mejora del comportamiento de tales redes en la ejecuci\u00f3n de tareas espec\u00edficas;<\/li>\n<li><strong>Un pipeline de seguridad<\/strong>: junto al modelo de aprendizaje profundo, hay t\u00e9cnicas ad-hoc dise\u00f1adas para mitigar las fragilidades del sistema en entradas inseguras y para prevenir comportamientos no deseados tanto en entradas seguras como inseguras.<\/li>\n<\/ul>\n<p class=\"no-indent\">En este punto, conscientes de los diferentes factores que caracterizan a LLM, solo nos queda explorar el potencial de tales sistemas poni\u00e9ndolos a prueba en nuestro contexto educativo. As\u00ed que, intenta hablar con ChatGPT o Bard para ayudar a crear nuevos ejercicios y adaptarlos a las necesidades espec\u00edficas de nuestros estudiantes, crear nuevos planes de lecci\u00f3n con contenido relacionado y mucho m\u00e1s. Depende de tu creatividad y de c\u00f3mo aprendas a dialogar con tales sistemas.<\/p>\n<p class=\"no-indent\"><strong>Nota<\/strong>: cada uno de estos factores requerir\u00eda una elaboraci\u00f3n particular. Para aquellos interesados, proporcionamos una lista de referencias.<\/p>\n<hr \/>\n<ul>\n<li data-start=\"125\" data-end=\"365\">\n<p data-start=\"128\" data-end=\"365\">Bengio, Y., Ducharme, R., &amp; Vincent, P. (2000). A neural probabilistic language model. <em data-start=\"215\" data-end=\"270\">Advances in Neural Information Processing Systems, 13<\/em>. <a href=\"https:\/\/papers.nips.cc\/paper_files\/paper\/2000\/file\/728f206c2a01bf572b5940d7d9a8fa4c-Paper.pdf\">https:\/\/papers.nips.cc\/paper_files\/paper\/2000\/file\/728f206c2a01bf572b5940d7d9a8fa4c-Paper.pdf<\/a><\/p>\n<\/li>\n<li data-start=\"367\" data-end=\"654\">\n<p data-start=\"370\" data-end=\"654\">Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., &#8230; &amp; Polosukhin, I. (2017). Attention is all you need. <em data-start=\"504\" data-end=\"559\">Advances in Neural Information Processing Systems, 30<\/em>. <a href=\"https:\/\/papers.nips.cc\/paper_files\/paper\/2017\/file\/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf\">https:\/\/papers.nips.cc\/paper_files\/paper\/2017\/file\/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf<\/a><\/p>\n<\/li>\n<\/ul>\n","protected":false},"author":3,"menu_order":5,"template":"","meta":{"pb_show_title":"on","pb_short_title":"","pb_subtitle":"","pb_authors":["fabrizio-falchi","manuel-gentile"],"pb_section_license":""},"chapter-type":[],"contributor":[68,74],"license":[],"part":134,"_links":{"self":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapters\/149"}],"collection":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapters"}],"about":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/wp\/v2\/types\/chapter"}],"author":[{"embeddable":true,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/wp\/v2\/users\/3"}],"version-history":[{"count":7,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapters\/149\/revisions"}],"predecessor-version":[{"id":823,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapters\/149\/revisions\/823"}],"part":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/parts\/134"}],"metadata":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapters\/149\/metadata\/"}],"wp:attachment":[{"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/wp\/v2\/media?parent=149"}],"wp:term":[{"taxonomy":"chapter-type","embeddable":true,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/pressbooks\/v2\/chapter-type?post=149"},{"taxonomy":"contributor","embeddable":true,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/wp\/v2\/contributor?post=149"},{"taxonomy":"license","embeddable":true,"href":"https:\/\/aiopentext.itd.cnr.it\/IAparaprofesores\/wp-json\/wp\/v2\/license?post=149"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}