Resumen:
En este trabajo nos proponemos poner a prueba las capacidades matemáticas de la
inteligencia artificial generativa (IAG). Mostramos estándares disponibles para evaluar el
desempeño de las herramientas que utilizan IAG para resolver problemas matemáticos.
Utilizando algunas aplicaciones de IAG en sus versiones gratuitas (los agentes conversacionales ChatGPT, Gemini, Poe, DeepSeek) evaluamos las respuestas que producen antes problemas que pueden presentarse en un curso de nivel medio de matemática.
Encontramos que estas aplicaciones han mejorado su precisión en las respuestas si se las compara con lo que respondían hace poco menos de un año, sin embargo algunas aún fallan en cálculos básicos, fundamentación de procedimientos o interpretación de consignas no explícitas.
Descripción:
Trabajo presentado y publicado en la Reunión de la Union Matemática Argentina, Bariloche, diciembre 2025.
Disponible: https://www.union-matematica.org.ar/images/noticiero/vol-60-num-3/completo.pdf