Skip to content
 
 

Latest commit

 

History

18 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ETL Project

Autor

Alberto García Cobo

linkedin

codewars

Intro

Proyecto personal para el porfolio de analista de datos. Se procederá a realizar una ETL de un dataset muy complejo, sucio y poco estructurado.

Data source

Puedes descargarte el dataset de Kaggle de aquí.

Files and folders

  • main.py: Contiene el código que ejecuta nuestra ETL pipeline.
  • test.ipynb: Jupyter Notebook para hacer pruebas.
  • functions: carpeta que contiene los archivos con las funciones correspondientes a ETL y auxiliares.
  • input: directorio para almacenar el csv de entrada.
  • output: directorio para guardar el resultado.
  • shark-data: directorio que contiene un archivo con un listado de tipos de tiburones que se usa en la ETL.

Modules

Son necesarias varias librerías en este proyecto. Por ser tan pocas no se emplea requirements.txt:

import re
import pandas as pd

Ejecución

Ejecuta la siguiente linea de comandos en la terminal de tu equipo:

$ python3 main.py

Resultado

El resultado de le ETL se almacena en documento CSV en la carpeta output.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages