MA2502 - Matemáticas para la Ciencia de Datos

Semana
1
Distribuciones e independencia
.png)
Bien entendidas, las bases de datos con las que se entrenan los modelos en Machine Learning son el resultado de un proceso aleatorio el cual puede modelarse con distintos tipos de distribuciones. Además estudiaremos el concepto de independencia que generaliza a la correlación. La correlación es una medida estadística que utiliza la frecuencia con la que dos variables se relacionan proporcionalmente con la misma constante. Pensemos por ejemplo en el número de metros cuadrados y el costo de un terreno.
Semana
2
Momentos y leyes de potencia

Gracias a los momentos estadísticos se pueden distinguir distintas distribuciones, en esta sección estudiaremos valor esperado, varianza y covarianza. También hablaremossobre las leyes de potencia las cuales son muy importantes para modelar fenómenos donde la realción lineal no es fácil de encontrarse entre las variables originales. Ejemplos detrás de estos fenómenos son por ejemplo las leyes de Zipf tan importanes en el lenguaje natural o las magnintudes de los terremotos.
Semana
3
Ley de los Grandes Números, Teorema límite Central y valores extremos

La Ley de los Grandes números es uno de los únicos resultados matemáticos que garantiza que una base de datos podría ser una buena aproximación a un resultado general, pensemos por ejemplo en un sondeo previo a una elección presidencial. Existen versiones alternativas a esta ley de los grandes números por ejemplo la que se utiliza en la teoría de los valores extremos.
Semana
4
Tests estadísticos

Una de las herramientas más importantes de los teoremas límite es la posibilidad de construir tests estadísticos como los intervalos de confianza. En esta semana nos concentraremos en las aplicaciones que tiene el TLC para realizar tests estadísticos en problemas del análsiis de supervivencia.
Semana
6
Sistemas de ecuaciones lineales

El aprendizaje supervisado es muy parecido al problema de resolver un sistema de ecuaciones lineales, en este caso las matrices formadas por la base de datos es muy similar a la de los coeficientes en un sistema de ecuaciones lineales.
Semana
7
Similitud del coseno & geometría lineal

Así como la correlación nos permite calcular las relaciones que existen entre dos columnas, es posible detectar cuando dos registros dentro de nuestra base de datos son semejantes por medio del ángulo entre nuestros vectores.
Semana
8
Análisis de componentes principales

Una de las técnicas de compresión más conocidas es el análsiis de componentes principales el cual construye una aproximación lineal de nuestra información mediante una cantidad menor de coordenadas. Podemos pensar en la información genética de las personas.
Semana
9
Descomposición en valores singulares

Las bases de datos con una enorme cantidad de textos son muy complicadas desde el punto de vista computacional y gracias a la factorización de matrices es posible eficientar este tipo de búsquedas.
Semana
Optimización lineal & método simplex

Aunque parezca una técnica poco sofisticada, la programación lineal es una de las herramientas más versátiles para resolver problemas de matemáticas aplicadas, es cierto que las soluciones no resuelven todos los problemas sin embargo una amplia cantidad de problemas se pueden resolver por medio de estas técnicas.
Semana
Derivadas, Método de Cauchy & Convexidad
.png)
Aunque no existe una explicación matemática satisfactoria de por qué funcionan los modelos de machine learning, utilizando el concepto de convexidad ayuda a entender algunos casos particulaes en los que sí existen teoremas de convergencia. El algoritmo que veremos en esta semana fue propuest originalmetne por Cauchy, la idea principal es optimizar siguiendo la dirección opuesta del gradiente.
Semana
Back-propagation & redes profundas

El algoritmo del gradiente descendiente sería inviable para entrenar a las redes neuronales con billones de parámetros y por ello fue necesario un algoritmo extra que permita que su entrenamiento sea viable. Este algoritmo se conoce como Back-Propagation y fue propuesto por Hinton a finales de los 90's.
Semana
14
Programación dinámica & refuerzo

La programación dinámica fue propuesta por Richard Bellman buscando resolver problemas en los que la dimensión es gigantesca, de hecho fue él quien acuñó el término de la maldición de la dimensión. Estas ideas son utilizadas por plataformas como Waze para encontrar la ruta óptima.
- Relevancia: la respuesta atiende directamente la pregunta.
- Fidelidad: cada afirmación está respaldada por el contexto recuperado.
- Cobertura de evidencia: el contexto contiene todas las piezas necesarias.
- Citas: las afirmaciones importantes apuntan a fragmentos concretos.
Video
V5.3. Evaluar un sistema RAG — 7 min.

Prácticas del módulo
Base de conocimiento: M05_base_conocimiento.md.
- Seleccionar hasta tres fragmentos para responder cada pregunta.
- Escribir “sin evidencia suficiente” cuando ningún fragmento contenga la respuesta.
- Comparar cortes por oración y por párrafo.
- Evaluar una respuesta con una rúbrica de relevancia, fidelidad, cobertura y citas.
Video de laboratorio
V5.4. Laboratorio en papel: consulta Nébula — 7 min.
Solución diferida: M05_solucion_rag.md.
RAG es una cadena: recuperar bien no garantiza redactar bien y una redacción convincente no compensa una fuente incompleta. Evaluar por etapas permite corregir el componente adecuado.
Un chunk es un fragmento recuperable. Si es demasiado corto, puede perder títulos, excepciones o relaciones. Si es demasiado largo, mezcla temas y añade ruido. El tamaño adecuado debe conservar una unidad de significado y responder al tipo de preguntas reales.

Un embedding representa el contenido mediante una lista de números que funciona como coordenadas. Los textos utilizados en contextos similares suelen quedar próximos, pero la cercanía semántica no equivale a verdad, vigencia, permiso o identidad.
Por ello, la similitud debe complementarse con metadatos como fecha, versión, región, producto, área responsable y permisos del usuario.
Video
V5.2. Fragmentos y embeddings — 8 min.

El archivista selecciona los fragmentos que llegan al contexto; el redactor produce la respuesta con ese material. Si una respuesta falla, se debe comprobar si la recuperación fue correcta, si el modelo respetó los fragmentos y si la fuente original era suficiente y vigente.
RAG significa generación aumentada por recuperación y puede entenderse mediante tres etapas:
- Recuperar: buscar fragmentos relacionados con la consulta.
- Aumentar: añadir los fragmentos relevantes al contexto de la pregunta.
- Generar: producir una respuesta basada en ese contexto y señalar las fuentes.
RAG no modifica los pesos del modelo; añade información pertinente en el momento de responder.
Video
V5.1. RAG en tres pasos — 8 min.

Antes de cargar información, identifica si contiene datos personales, financieros, laborales, legales, de salud, credenciales o secretos. Comprueba que la herramienta, la cuenta y la finalidad estén autorizadas; minimiza los datos y conserva bajo control humano cualquier decisión que afecte a una persona.
Video
V4.3. Datos, privacidad y seguridad — 7 min.
Actividad
Clasificar cinco escenarios como permitido, requiere autorización o no debe realizarse así.
Cierre para la plataforma
La confianza no proviene del tono de una respuesta. Proviene de evidencia rastreable, límites claros y una revisión proporcional al impacto.
Comprobación y transferencia
- Knowledge check de seis reactivos — 10 min.
- Registrar una afirmación que siempre deba verificarse, su fuente primaria y una decisión que deba permanecer bajo control humano.
Según la tarea, debe priorizarse el documento original, una norma, un conjunto de datos o una comunicación oficial; después, la documentación técnica, los artículos académicos, las fuentes secundarias reputadas y, finalmente, los agregadores o publicaciones sociales.
Cada cita debe abrirse y revisarse para confirmar autor, fecha, versión y fragmento de soporte.
Contenido 4.6. Privacidad, seguridad y supervisión
Antes de cargar información, identifica si contiene datos personales, financieros, laborales, legales, de salud, credenciales o secretos. Comprueba que la herramienta, la cuenta y la finalidad estén autorizadas; minimiza los datos y conserva bajo control humano cualquier decisión que afecte a una persona.
Video
V4.3. Datos, privacidad y seguridad — 7 min.
Actividad
Clasificar cinco escenarios como permitido, requiere autorización o no debe realizarse así.
Cierre para la plataforma
La confianza no proviene del tono de una respuesta. Proviene de evidencia rastreable, límites claros y una revisión proporcional al impacto.
La consulta rápida sirve para localizar un dato puntual, una definición vigente o una página oficial. La investigación profunda es adecuada cuando se deben combinar fuentes, comparar metodologías, resolver contradicciones o elaborar un informe documentado.
La profundidad no depende de la longitud de la tarea, sino de la necesidad de investigar, contrastar y sintetizar.
Video
V4.4. Investigación con fuentes — 6 min.
- Respaldada: la fuente contiene evidencia directa y suficiente.
- Contradicha: la fuente presenta un dato incompatible.
- No sustentada: existe información relacionada, pero no alcanza para concluir.
- No verificable: no se cuenta con la evidencia necesaria para confirmar o refutar.
No encontrar evidencia no significa automáticamente que una afirmación sea falsa.

Laboratorio
Archivos: M04_memo_generado.md y M04_paquete_evidencia.md.
Entregable: tabla con ID, Afirmación, Estado, Evidencia, Corrección propuesta y Confianza.
Solución diferida: M04_solucion_verificacion.md.
El proceso de verificación consta de cinco acciones:
- separar la respuesta en afirmaciones;
- localizar evidencia para cada afirmación;
- clasificar su estado;
- corregir con la información disponible;
- comprobar nuevamente el resultado.
Video
V4.2. Verificación por afirmaciones — 8 min.

Una alucinación es contenido generado que parece responder a la pregunta, pero es falso o no está respaldado. Puede presentarse como una fecha inventada, una cita inexistente, una cifra sin fuente, una atribución incorrecta o una conclusión más fuerte que la evidencia.
Una demostración exitosa no garantiza un proceso confiable. La estabilidad debe evaluarse mediante varios casos y criterios definidos.
Video
V4.1. Por qué alucina una salida convincente — 8 min.
Un modelo visual puede describir tendencias y leer etiquetas, pero también puede confundir escalas, leyendas o valores pequeños. Antes de aceptar una interpretación conviene identificar el título, el periodo, los ejes, las unidades, la leyenda, los valores visibles y aquello que no puede leerse con confianza.
Video
V3.4. Imágenes y gráficos sin adivinar — 7 min.
Actividad visual
Observar el tablero de cartera y responder qué sucursal presenta morosidad, si el gráfico demuestra sus causas y qué información adicional sería necesaria antes de recomendar una acción.
La calidad de un análisis multimodal depende de la calidad de la extracción. Inventariar, comprobar y reconciliar son parte central del razonamiento.
Comprobación y transferencia
- Knowledge check de seis reactivos — 10 min.
- Identificar un archivo de uso frecuente, sin cargarlo, y anotar qué elementos podrían perderse y qué controles deberían aplicarse.
Antes de solicitar conclusiones sobre una tabla, se deben identificar encabezados, número de registros, tipos de datos, valores faltantes, unidades y formatos de fecha. Toda cifra incluida en un resumen debe poder rastrearse hasta una columna y una operación.
Video
V3.3. Hojas de cálculo: preguntar, comprobar, interpretar — 9 min.
Práctica descargable
Archivo: M03_datos_practica.xlsx
Actividad: inventariar la hoja, calcular controles, crear banderas didácticas y comprobar los resultados de manera independiente.
Solución diferida: M03_solucion_datos.md.

El reconocimiento óptico de caracteres convierte imágenes de texto en caracteres. Puede confundir letras y números, comas y puntos decimales, columnas, firmas, sellos o texto inclinado. Cuando la fidelidad literal importa, la herramienta no debe corregir silenciosamente el documento.
Video
V3.2. Extracción documental con trazabilidad — 8 min.
Práctica descargable
Archivo: M03_minicontrato_sintetico.txt
Entregable: tabla con Campo, Valor extraído, Evidencia literal, Confianza y Revisión necesaria.
Solución diferida: M03_solucion_minicontrato.md.
La herramienta debe convertir el archivo en una representación procesable. Puede extraer texto, reconocer caracteres, leer celdas, describir imágenes o dividir el contenido. Durante este proceso pueden perderse encabezados, tablas, notas al pie, signos, unidades, orden de lectura o relaciones entre cifras y etiquetas.
La secuencia recomendada es:
- inventariar el archivo;
- extraer los campos necesarios;
- comprobar muestras, unidades y totales;
- analizar únicamente cuando la representación sea suficiente.
Video
V3.1. Qué ocurre cuando cargas un archivo — 8 min.

En tareas complejas conviene solicitar productos que una persona pueda revisar: supuestos, fórmulas, evidencia, cálculos con unidades, datos faltantes, incertidumbres y una justificación breve. No es necesario pedir que el modelo exponga toda su cadena interna de razonamiento.
Video
V2.5. Razonamiento sin pedir cadena de pensamiento — 8 min.
Prácticas del módulo
- Clasificación con ejemplos: crear primero una versión zero-shot y después añadir un ejemplo únicamente si mejora el formato o aclara los límites.
- Correo ejecutivo: construir un prompt MARCO para redactar un correo de máximo 140 palabras con cifras verificadas.
- Taller de plantilla reutilizable: probar la misma plantilla con una entrada completa y otra incompleta.
Un buen prompt no obliga al modelo a adivinar qué significa “bien”. MARCO convierte una intención en un resultado que puede revisarse, repetirse y mejorar.
Una instrucción como “hazlo mejor” no explica qué debe cambiar. Para iterar de forma útil:
- genera una primera versión;
- evalúala con una lista de criterios;
- identifica el defecto de mayor impacto;
- solicita un cambio localizado;
- comprueba nuevamente el resultado.
Las tareas recurrentes pueden convertirse en plantillas al separar las partes fijas de los datos variables.
Video
V2.4. Iteración y plantillas — 8 min.
Archivo: M02_plantilla_MARCO.md
Antes de enviar una instrucción, revisa:
- si la meta describe una acción observable;
- si los datos están delimitados;
- si las reglas resuelven casos ambiguos;
- si el formato permite comprobar que nada falta;
- si existe un criterio de éxito independiente del estilo de redacción.
Cuando falte información, la respuesta debe señalarlo en lugar de inventarla. Puede agregarse una sección final de Comprobaciones con criterios cumplidos, supuestos y puntos que requieren revisión humana.
Video
V2.3. Del prompt vago al verificable — 8 min.
- Zero-shot: la instrucción no contiene ejemplos; es el punto de partida cuando la tarea y el formato son claros.
- One-shot: se incluye un ejemplo de entrada y salida para mostrar un patrón.
- Few-shot: se incluyen varios ejemplos para representar casos variados o límites de una clasificación.
Más ejemplos no siempre producen una mejor respuesta. Cada ejemplo debe ser consistente con las reglas y con el formato solicitado.
Video
V2.2. Zero-, one- y few-shot — 7 min.

Un prompt útil se parece a una especificación breve. El método MARCO reúne cinco decisiones:
- M — Meta: verbo observable y resultado esperado.
- A — Antecedentes: audiencia, situación y datos relevantes.
- R — Rol y reglas: perspectiva útil, límites y prohibiciones.
- C — Criterios de éxito: condiciones que permiten comprobar la calidad.
- O — Output: estructura exacta de la respuesta.
Video
V2.1. El método MARCO — 9 min.

- Chat: transforma, resume, redacta o explica a partir del contexto disponible.
- Búsqueda: localiza información actual y fuentes verificables.
- Trabajo con archivos: responde con base en documentos seleccionados.
- RAG: recupera fragmentos pertinentes de una colección amplia antes de responder.
- Agente: persigue un objetivo mediante varios pasos y puede utilizar herramientas o preparar acciones.
A mayor capacidad de actuar, mayor necesidad de permisos, registros, límites y aprobación humana.
Video
V1.4. Cinco confusiones que debes evitar — 7 min.

Práctica del módulo
La herramienta mínima suficiente
El participante deberá elegir entre chat, búsqueda, fuentes, RAG o agente para cinco tareas y registrar una razón y un riesgo en cada caso:
- Cambiar un comunicado técnico a lenguaje ciudadano.
- Confirmar una tasa de referencia vigente.
- Contestar preguntas sobre tres políticas internas.
- Consultar una colección de diez mil manuales y reportes.
- Recibir una solicitud, consultar reglas, preparar una recomendación y enviarla después de aprobación.
Cierre para la plataforma
Un modelo generativo es una herramienta flexible de transformación y generación, no una autoridad. Elegir la modalidad adecuada es la primera decisión de calidad y seguridad.
Un token es una unidad que procesa el modelo. Puede ser una palabra completa, una parte de una palabra o un signo. La ventana de contexto es la cantidad de información que el sistema puede considerar durante una interacción.
Cuando el material es extenso, algunos fragmentos pueden quedar fuera o recibir menor atención. Para reducir este riesgo conviene separar instrucciones, datos y ejemplos; hacer visibles las reglas importantes y dividir las tareas complejas en productos intermedios comprobables.
Los sistemas de lenguaje han evolucionado desde reglas escritas manualmente y patrones estadísticos hasta representaciones vectoriales, mecanismos de atención y herramientas capaces de consultar fuentes o ejecutar funciones. Esta evolución explica capacidades distintas; no debe presentarse únicamente como una lista de marcas o productos.
Video
V1.2. Una historia útil, sin convertirla en museo — 8 min.

Un modelo del lenguaje recibe una secuencia de unidades de texto y calcula qué continuación resulta plausible. Repite este proceso muchas veces hasta formar una respuesta. La fluidez proviene de patrones aprendidos a gran escala, pero no demuestra que cada afirmación haya sido verificada.
Por ello, la pregunta útil no es solamente “¿la IA sabe esto?”, sino “¿qué información tuvo disponible y cómo puedo comprobar su respuesta?”.
Video
V1.1. Qué genera un modelo de lenguaje — 7 min.

Actividad interactiva
Presentar varias frases incompletas para que el participante elija o proponga continuaciones posibles. La retroalimentación debe explicar que pueden existir varias continuaciones plausibles y que el contexto modifica su probabilidad.
Actividades
- Ver el video V0.1. Bienvenida y contrato de aprendizaje — 5 min.
- Registrar una meta personal de aprendizaje.
- Aceptar el acuerdo de uso responsable.
- Contestar el diagnóstico inicial de diez reactivos, sin calificación.
Evaluación Diagnostica
No cargues información personal, confidencial, credenciales ni archivos reales de tu organización. Todas las prácticas del curso utilizan datos sintéticos. En situaciones laborales, consulta siempre las políticas institucionales y utiliza únicamente herramientas autorizadas.
