Clasificación en Tiempo Real
Analiza mensajes de correo electrónico usando modelos de Machine Learning tradicionales o LLMs integrados.
Escribe un mensaje y haz clic en "Analizar Mensaje" para ver el diagnóstico detallado aquí.
Análisis Exploratorio de Datos (EDA)
Explora y comprende la composición semántica y estadística del conjunto de datos.
—
—
—
—
Distribución de Clases
Proporción de correos Spam vs. Ham (Legítimos) en el conjunto de datos.
Longitud de Mensajes
Promedio de palabras por categoría de correo.
Agregar Muestra
Alimenta la base de datos para expandir el dataset de entrenamiento de forma dinámica.
Palabras de Spam más Comunes
Excluyendo palabras vacías (stop words).
Palabras de Ham más Comunes
Frecuencia en correos legítimos.
Métricas de Evaluación de Modelos
Compara el rendimiento de todos los algoritmos implementados en el conjunto de prueba.
Métricas Comparativas
Evaluación sobre la división de prueba estratificada.
Haz clic en la pestaña Métricas para cargar los resultados de la evaluación.
| Modelo | Exactitud (Accuracy) | Precisión | Sensibilidad (Recall) | F1 Score |
|---|
Matriz de Confusión
Selecciona un modelo para ver la distribución de predicciones.
Visualización Polar
Gráfico de radar que compara todos los modelos a la vez. El modelo seleccionado se resalta.
Análisis Comparativo de Rendimiento
Comparación en tiempo real entre el procesamiento clásico con Bolsa de Palabras (BoW) y Embeddings Multilingües.
Bolsa de Palabras (Bag of Words)
Representación simple basada en la frecuencia de las palabras más comunes.
- Dimensión del Vocabulario: 500 características (Espacio Disperso)
- Tiempo de Carga en Memoria: 0.00s (Instantáneo)
- Tiempo Vectorización (Dataset): 0.0008 s
- Latencia Inferencia Promedio: 0.02 - 0.04 ms
- Consumo de RAM/CPU: Extremadamente Bajo (< 1 MB)
- Soporte de Idiomas: Monolingüe (requiere diccionario estático)
Embeddings (MiniLM-L12-v2)
Representación semántica densa basada en redes neuronales preentrenadas.
- Dimensión del Vector: 384 características (Espacio Denso)
- Tiempo de Carga en Memoria: 41.74 s (Carga de pesos binarios)
- Tiempo Vectorización (Dataset): 0.4865 s (80 correos)
- Latencia Inferencia Promedio: 20.89 ms
- Consumo de RAM/CPU: Alto (~450 MB en RAM)
- Soporte de Idiomas: Multilingüe Nativo (Español/Inglés/etc.)
Latencia de Inferencia por Correo (ms)
Escala logarítmica para ilustrar la diferencia computacional de ambos enfoques.
Comparativa General: Precisión vs. Velocidad
La relación entre la exactitud final obtenida y el costo de procesamiento.
Enfoque Tradicional (ML) vs. Modelos de Lenguaje (LLMs)
Comparativa de costos operativos, velocidad y requisitos de infraestructura.
| Parámetro / Métrica | ML Clásico Local (Naive Bayes / LR) | LLM Cloud API (Groq Llama 3.3) | LLM Local (Ollama Llama 3.1) |
|---|---|---|---|
| Latencia de Respuesta | < 0.5 ms (Ultra rápido) | ~300 - 800 ms (Red + Nube) | ~1,500 - 5,000 ms (Cómputo local) |
| Costo de API (por 1M correos) | $0.00 (Gratis) | ~$2.80 USD (Pago por Uso) | $0.00 (Gratis) |
| Dependencia de Internet | No (100% Offline) | Sí (Obligatorio) | No (100% Offline) |
| Requisito de Hardware | Muy bajo (cualquier CPU básica) | Muy bajo (cómputo remoto) | Muy alto (Requiere GPU dedicada de 8GB+ VRAM) |
| Privacidad de Datos | Total (Local) | Compartido (Nube) | Total (Local) |
Análisis Técnico para Exposición
¿Por qué Bag of Words (Naive Bayes) obtuvo 100% de precisión frente al 85% de Embeddings?
Al ser un dataset pequeño (80 correos), los patrones de spam son muy marcados por palabras clave explícitas ("win", "free", "urgent"). El modelo probabilístico clásico se ajusta perfectamente. Sin embargo, los embeddings (384 dimensiones) sufren de la maldición de la dimensionalidad al tener solo 60 muestras de entrenamiento, lo que dificulta que el clasificador generalice sin más datos.
¿Por qué los Embeddings tardan casi 1000 veces más en clasificar?
El Bag of Words hace búsquedas simples en un mapa de hash del vocabulario. En cambio, los Embeddings pasan la oración por un modelo Transformer de 12 capas (MiniLM), ejecutando millones de multiplicaciones de matrices de punto flotante en CPU para calcular los coeficientes de autoatención para cada token de la frase.
Entrenamiento y Ajuste de Hiperparámetros
Configura las variables de entrenamiento para cada algoritmo y ejecuta la optimización por búsqueda en rejilla (Grid Search).
Configurar Parámetros del Modelo
Hiperparámetros de Red Neuronal
Resultados del Ajuste
Esperando comando. Elige hiperparámetros o ejecuta una búsqueda en rejilla.