La IA es solo una herramienta, que puede hacerse muy poderosa, cuando el que la usa SABE matemáticas .
Igualmente se podría decir que un estudiante de matemáticas es sólo una herramienta, que puede hacerse muy poderosa cuando el que le enseña sabe matemáticas.
No es tan fácil como decirle: as una lista y enuncia todos los problemas matemáticos abiertos por orden de antigüedad, resuelvelos, redacta cada demostración como teorema escribelo en formato látex, imprime todo en formato pdf, paginado para papel A4 vertical.
Y así seguro no dará nada de lo que se espera.
Hay que ser claro y conciso, decirle que herramientas tiene que usar y de que resultados y trabajos previos puede basarse.
Pero eso no es así. Si miras el enlace de geómetracat y pulsas en "read the proof", verás (en la página 3) el prompt exacto que se le puso a ChatGPT. Sólo contiene el enunciado del problema y un par de precisiones sobre qué características tiene que tener una respuesta válida, para excluir respuestas parciales. Pero no dice nada sobre qué técnicas puede emplear o en qué debe basarse.
A continuación está la respuesta que dio ChatGPT, que contiene un argumento válido que resuelve el problema, sólo que muy resumido porque da por conocidos hechos conocidos de teoría algebraica de números, geometría algebraica, teoría de grupos, etc. El resto del artículo es un desarrollo que detalla la respuesta de ChatGPT sin llenar ninguna laguna, aunque simplificando algunos pasos que en la respuesta original eran más complicados de lo necesario.
Llamar a eso herramienta es como decir que Wiles es la herramienta de la que se han valido los matemáticos para demostrar el Último Teorema de Fermat.
Lo que quiero decir es que estos ejemplos prueban que una IA puede razonar, exactamente en el mismo sentido (pero no por el mismo proceso) en que decimos que razona un matemático. Razonar es generar razonamientos válidos (incluso se puede decir que alguien que genera razonamientos inválidos razona, siempre que sea capaz de reconocer sus errores cuando se le señalan, porque los matemáticos humanos también se equivocan razonando). No puede decirse que algo "parece que razona" si no es que razona. No hay diferencia entre "razonar" y "parecer que se razona". Si algo parece que razona, es que razona.
Aquí hacen falta tres matices importantes:
1) No tiene que haber trampa. Por ejemplo, si meto un walkie-talkie en una caja de zapatos, un ingénuo podría creer que la caja de zapatos es una máquina inteligente, porque responde inteligentemente a las preguntas que se le hacen, cuando en realidad hay truco: la persona inteligente es la que está en otro sitio con el otro walkie-talkie.
Pero no es el caso que nos ocupa: no hay ningún humano dictándole las respuestas a ChatGPT.
2) Como caso particular, no vale copiar. Si le pedimos a ChatGPT una demostración del teorema del valor medio y nos da una demostración copiada de internet, puede parecer que ChatGPT ha razonado, pero no es necesariamente así. Podría haber generado de su cosecha un razonamiento, pero también podría haber copiado un razonamiento de internet (y esto es lo más probable). Copiar un razonamiento generado por otro no es generar un razonamiento, y puede dar lugar a que parezca que algo razona cuando no es así.
No es el caso: ChatGPT no ha podido copiar los razonamientos de los dos problemas considerados en este hilo porque nadie conocía la respuesta. Podemos decir que ChatGPT ha generado los razonamientos. Obviamente no de la nada, puesto que tenía mucho material a su disposición, pero eso vale también para Wiles, que demostró el UTF usando muchos resultados previos que conocía.
Y el punto más delicado:
3) No vale sustituir razonamiento por capacidad de cálculo.
Por ejemplo, el ajedrez es un juego finito. O bien las blancas tienen una estrategia ganadora, o bien la tienen las negras, o bien existe una estrategia que garantiza al menos tablas si el contrario no se equivoca nunca (de modo que si la usan los dos jugadores se acaba siempre en tablas). Por simplificar, supongamos que las blancas tienen una estrategia ganadora. Eso significa que si las blancas jugaran siempre la jugada más adecuada, ganarían todas las partidas, hagan lo que hagan las negras.
El problema es que encontrar la estrategia ganadora requeriría analizar todas las situaciones posibles del tablero, y eso excede con creces la capacidad de cálculo de cualquier ordenador. Por eso, un jugador de ajedrez usa su inteligencia para seleccionar la mejor jugada, como sustituto de la fuerza bruta consistente en considerar todas las jugadas posibles que pueden darse a partir de una situación inicial dada. Si un ordenador alcanzara la capacidad de cálculo necesaria para calcular todas las jugadas posibles en un tiempo razonable, ganaría siempre que jugara con blancas, y eso no significaría que fuera más inteligente que un humano, ni que supiera razonar estrategias. Simplemente estaría aplicando un algoritmo trivial, esencialmente el mismo que podemos aplicar para hacer tablas en el tres en raya: mirar todas las posibilidades y asegurarse de que nuestra jugada no da al contrario una oportunidad de ganar.
En aquellos problemas en los que se usa la inteligencia porque una solución por fuerza bruta es inabordable, el uso de la fuerza bruta puede parecer inteligencia, y un ordenador que llegue a una respuesta barriendo todas las posibilidades puede parecer que ha razonado, cuando en realidad no ha razonado nada.
Pero no es el caso aquí. En un caso así el producto es una respuesta sin razonamiento:
—¿Cuántas posibilidades hay de tal cosa?
— \( 89\,884\,455\,300\,000 \)
—¿Cómo lo has averiguado?
—Las he enumerado todas.
Eso no requiere ningún razonamiento, más allá de lo necesario para asegurarse de que se generan todos los casos posibles sin repetición, pero lo cierto es que tampoco genera ningún razonamiento. En cambio, un matemático puede llegar al mismo resultado con un argumento combinatorio que no requiera generar todos los casos posibles, y eso se traduce en un razonamiento que expresa la respuesta.
Pero de nuevo no es el caso aquí. En los dos problemas, ChatGPT ha generado un razonamiento, un razonamiento que no ha podido copiar de internet y que consiste en un argumento matemático, en una manipulación de teoremas conocidos para obtener un resultado nuevo y, a vista de pájaro, no me parece que ninguna parte de la prueba se apoye en un cálculo que exceda las capacidades humanas. Al contrario, es un argumento que perfectamente habría podido generar un humano si se le hubiera ocurrido. Aunque la capacidad de cálculo puede ser una ventaja en muchos casos, en éstos no parece que haya influido en nada.
Teniendo en cuenta que no se aplican estas tres objeciones, lo que digo es que si parece que ChatGPT ha resuelto razonadamente unos problemas, es que ChatGPT ha resuelto razonadamente esos problemas. El "parece" carece de significado. Con estas salvedades, "parecer" es lo mismo que "ser".
Pero lo más importante que estoy afirmando es que no vale decir: Carlos, eres un ingenuo, ChatGPT no es más que un algoritmo, no piensa, no tiene conciencia. Nada de lo que digo contradice esto. Sólo digo que algo que genere razonamientos, lo haga como lo haga (con los tres matices precedentes) está razonando. No hace falta que tenga conciencia, ni que "piense" en un sentido "más humano" de la palabra, ni importa para nada que sea un algoritmo.
Si llegáramos a Marte y nos encontráramos con unos seres que "parecen" razonar, tendríamos que juzgar si razonan o no evaluando sus razonamientos. No importaría para nada si sus cerebros se parecen más a los nuestros o se parecen más a ChatGPT.
Con esto no digo que actualmente ChatGPT tenga la misma capacidad de razonamiento matemático que un humano. Sólo digo que estos ejemplos ponen en evidencia que ChatGPT puede razonar matemáticamente de forma autónoma (sin que nadie le diga lo que tiene que hacer). Es posible que de momento sus capacidades sólo generen demostraciones válidas en pocos casos, pero también hay que tener en cuenta que se ha usado una IA genérica, no especializada en matemáticas. No es descabellado que versiones más sofisticadas aumenten drásticamente su eficiencia en generar nuevos argumentos válidos que resuelvan problemas cada vez menos triviales.
En la página que cita Geómetracat hay también un enlace "Read the companion remarks" en el que varios matemáticos comentan el fenómeno. Creo que es interesante leerlo. Discrepo con algunos. Por ejemplo:
One aspect of this proof should not be overlooked: while the original proof produced by AI was completely valid, it was significantly improved by the human researchers at OpenAI and the many other mathematicians involved in the present paper. The human still plays a vital role in discussing, digesting, and improving this proof, and exploring its consequences.
Eso es capcioso. Cuando un matemático humano da una primera demostración de un teorema complicado, no es raro que luego otros matemáticos encuentren formas de simplificarla. Eso no es algo que distinga a un humano de ChatGPT. Nada impide que se dé el fenómeno inverso: que ChatGPT simplifique un argumento dado por un humano, o que ChatGPT encuentre una simplificación de un argumento generado por ChatGPT.