study_data_engineering

View on GitHub

Focuing on


Lectures


Useful References


IaaS Platform

Openstack

Amazone EC2

Google Compute Engine

Azure IaaS

DigitalOcean


PaaS Platoform

Cloud Foundry

Amazon Lamda

Google App Engine

Microsoft App Service


Linux OS

CoreOS


Distributed Platform

Openshift

DC/OS


Distributed Framework

Mesos


Container Framework

Docker

LXC


Container Orchestration

Kubernetes

Marathon

Docker Swarm

Amazon ECS

HashiCorp Nomad

Metronome

Chronos

Aurora


Data warehouse (Datalake)

Hadoop Ecosystem

Amazon Redshift

Snowflake


Security

Kerberos

LDAP

Knox

Ranger


Data Companies

Amazone AWS

Google Cloud

Microsoft Azure

Alibaba Cloud

IBM Cloud

SAP Cloud

Oracle Cloud

Red Hat Cloud suite

Apache Cloud Stack

Cloudera

Hotornworks

Databricks

Teradata

Snowflake


Workflow

Airflow

Azkaban

Oozie

Luigi

Dkron

Nomad

Data Ingestion

Kafka

RabbitMQ

Sqoop


Data Stream Processing

Spark Streaming


Data Batch Processing

Mapreduce

Hive

Spark

Presto

Storm

Impala

Pig

Samza

Imply

Mahout

HAWQ

Drill

Kylin


Databases

MySQL

Mongo DB

ElasticSearch

Redis

HBase

InfluxDB

OpenTSDB

Prometheus

Cassandra

Riak

Druid


Business Intelligence (Analysis & Visualization)

Hue

Yanagishima

Tableau

Kibana

Grafana

Chronograf

Superset

Metabase

redash

Zeppelin

IBM Cognos Analytics

File System

HDFS


Data Serialization Formats

ORC

Avro

JSON

BSON

Protocol Buffers

Thrift

YAML

XML


Log Collector

Flunetd

Logstash

Beats

StatsD

collectd

dd-agent

Telegraf

logrotate

Graphite

Flume


Tracing

Zipkin


Configuration Management

Ansible

Chef

Salt

CFEngine

Puppet

Vagrant

Web Servers

Nginx

Apache

Tomcat

Jetty


Distributed Synchronization Service

Zookeeper


Uncategorized

Data Visualization libraries