Análisis de datos.
"La clave del ÉXITO es ATREVERSE a pensar diferente y a transformar cada idea en acción."
Tengo un dataset en CSV con información de [VARIABLE_1], [VARIABLE_2], [VARIABLE_3]. Utiliza Python (pandas) para limpiarlo: elimina filas con NaN, corrige datos duplicados y normaliza la columna [VARIABLE_2]. Finalmente, genera un archivo limpio listo para análisis.
Utilidad: Preprocesamiento completo del dataset para análisis posterior.
Aplica un modelo de clustering k-means para segmentar a mis clientes según [VARIABLE_1] y [VARIABLE_2]. Justifica cuántos clústers elegir con el método del codo (Elbow Method) y describe cada segmento.
Utilidad: Segmentación de clientes y justificación de clústers.
Crea un pronóstico de series temporales con [MODELO_ARIMA] sobre mi histórico de [VARIABLE_TIEMPO] para predecir los próximos [NÚMERO_DE_MESES] meses. Incluye un gráfico comparativo de valores reales vs. valores predichos.
Utilidad: Anticipa tendencias futuras en datos secuenciales.
Desarrolla una pipeline de datos (ETL) donde se extraiga información de [ORIGEN_DATOS], se transforme unificando formatos de fecha y moneda, y se cargue en [DESTINO_DATOS]. Proporciona ejemplos de código en [LENGUAJE] para cada paso (extract, transform, load).
Utilidad: Implementa un flujo de datos automatizado y consistente.
Desarrolla un script de Python que conecte a la API de [FUENTE_DE_DATOS], obtenga los registros y los almacene en una base de datos SQL. Luego realiza una consulta para calcular la media y desviación estándar de [CAMPO_NUMÉRICO].
Utilidad: Integra recolección de datos vía API con almacenamiento y análisis.
Genera un informe en PDF que muestre el top 10 de [VARIABLE_CATEGÓRICA] con mayor frecuencia y el porcentaje que representan. Añade un diagrama de Pareto para visualizar la concentración de [VARIABLE_CATEGÓRICA].
Utilidad: Crea un reporte gerencial estilo 80/20.
Genera un script en R que realice un análisis de componentes principales (PCA) sobre mi dataset [NOMBRE_DEL_DATASET], muestre la varianza explicada de cada componente y cree un gráfico biplot.
Utilidad: Reduce dimensionalidad y facilita la interpretación visual de variables.
Analiza un archivo de logs (en [FORMATO]) para detectar patrones de error en una plataforma web. Identifica las 3 rutas con mayor tasa de error y sugiere 2 soluciones para reducirlos. Presenta resultados en un breve informe de 1 página.
Utilidad: Localiza problemas de rendimiento y ofrece un plan de acción.
Usando este conjunto de datos de transacciones (en formato JSON), crea un dashboard en [HERRAMIENTA_BI] que muestre: total de transacciones, ticket promedio, hora pico de compras y un mapa de calor por días de la semana. Explica los pasos para integrarlo en un reporte interactivo.
Utilidad: Facilita un panel visual con métricas clave y visualizaciones avanzadas.
Utiliza un modelo de machine learning supervisado para predecir [VARIABLE_OBJETIVO]. Explica por qué elegiste [MODELO (p.ej. Random Forest)], cómo optimizaste los hiperparámetros y muestra la matriz de confusión final.
Utilidad: Demuestra el proceso de selección de modelo y evaluación de desempeño.