Open-Awesome
CategoriesAlternativesStacksSelf-HostedExplore
Open-Awesome

© 2026 Open-Awesome. Curated for the developer elite.

TermsPrivacyAboutGitHubRSS
  1. Home
  2. Tags
  3. Big Data

Big Data

258 projects

Showing 36 of 258 projects

akela
akelaJava

Mozilla's utility library for Hadoop, HBase, Pig, and related big data technologies.

#mapreduce#hbase#java
Stars77
Forks31
Last commit12 years ago
php-tdengine
php-tdenginePHP

A PHP client extension for the TDengine big data engine, with Swoole coroutine support.

#database-driver#swoole#tdengine-client
Stars77
Forks9
Last commit3 years ago
Beetest
BeetestJava

A simple utility for testing Apache Hive scripts locally without requiring Java development skills.

#unit-testing#apache-hive#data-engineering
Stars73
Forks23
Last commit9 years ago
count-min-log
count-min-logGo

Go implementation of Count-Min-Log sketch for improved approximate counting of low-frequency events.

#probabilistic-data-structures#stream-processing#go-library
Stars70
Forks6
Last commit1 year ago
Hive_test
Hive_testJava

A unit test framework for Hive scripts that provides an embedded Hive environment with Derby database and HiveThriftService.

#unit-testing#apache-hive#java
Stars65
Forks47
Last commit4 years ago
emr-sample-apps
emr-sample-appsJava

Code samples demonstrating how to use popular applications on Amazon Elastic MapReduce (EMR).

#mapreduce#educational#code-samples
Stars63
Forks51
Last commit11 years ago
Map/Reduce implementations of common ML algorithms
Map/Reduce implementations of common ML algorithmsJupyter Notebook

Jupyter notebooks for hands-on Big Data Analytics exercise classes covering Spark ML, Map/Reduce algorithms, and deep learning.

#spark#educational#data-science
Stars62
Forks27
Last commit
json-streamer
json-streamerRuby

A Ruby gem for extracting data from JSON streams based on keys, nesting levels, or custom conditions without implementing low-level callbacks.

#stream-processing#event-driven#json-stream
Stars60
Forks9
Last commit1 year ago
diver
diverJava

An Erlang/Elixir driver for HBase that uses a Java server with Asynchbase to provide asynchronous database queries.

#elixir#hbase#distributed-systems
Stars51
Forks7
Last commit9 years ago
s4
s4Java

A distributed platform for processing continuous unbounded streams of data with a clean API and fault tolerance.

#stream-processing#event-processing#real-time-analytics
Stars44
Forks16
Last commit7 years ago
Elasticsearch
ElasticsearchJava

An Elasticsearch river plugin for importing data from HBase into Elasticsearch.

#search-indexing#distributed-storage#data-integration
Stars39
Forks35
Last commit12 years ago
EtlBox.Classic
EtlBox.ClassicC#

A lightweight ETL library and data integration toolbox for .NET, enabling programmatic data flow pipelines.

#database#data-integration#csharp
Stars34
Forks14
Last commit1 day ago
Impala
ImpalaC++

A massively-parallel C++ SQL query engine for lightning-fast analytics on petabytes of data in Hadoop clusters.

#real-time-queries#sql-query-engine#c-plus-plus
Stars34
Forks32
Last commit3 years ago
hdfs-rs
hdfs-rsRust

Rust bindings and safe wrapper APIs for Hadoop's libhdfs, enabling HDFS access from Rust applications.

#distributed-storage#ffi#rust-bindings
Stars31
Forks10
Last commit10 years ago
clusterdock
clusterdockPython

clusterdock is a framework for creating Docker-based container clusters

#docker#big-data#hadoop
Stars30
Forks8
Last commit3 years ago
Archives Unleashed Notebooks
Archives Unleashed NotebooksJupyter Notebook

Example notebooks for analyzing web archives using the Archives Unleashed Toolkit.

#web-archives#spark#pyspark-notebook
Stars26
Forks5
Last commit3 years ago
DelphiCassandra
DelphiCassandraPascal

A Delphi framework for connecting to and performing CRUD operations on Apache Cassandra databases using the DataStax C/C++ driver.

#nosql#database-client#datastax-driver
Stars25
Forks9
Last commit9 years ago
Hugegraph/Hugegraph
Hugegraph/HugegraphJava

A fast, highly-scalable graph database supporting over 10 billion vertices and edges with OLTP capabilities and dual Gremlin/Cypher query language support.

#raft-consensus#java#gremlin
Stars25
Forks3
Last commit1 day ago
Spark Cassandra Stress
Spark Cassandra StressScala

A tool for testing the DataStax Spark Connector against Apache Cassandra or DataStax Enterprise.

#gradle#stress-testing#testing-tool
Stars25
Forks12
Last commit3 years ago
vessel
vesselElixir

An Elixir MapReduce framework with Hadoop Streaming integration, simplifying distributed data processing.

#mapreduce#elixir#mix-tasks
Stars24
Forks1
Last commit5 years ago
sample KafkaSparkCassandra
sample KafkaSparkCassandraScala

A Scala sample application demonstrating Spark Streaming integration with Kafka and Cassandra for data processing.

#apache-spark#real-time-analytics#scala
Stars22
Forks23
Last commit7 years ago
ankush
ankushJava

A big data cluster management tool that creates and manages multi-technology clusters with health monitoring.

#devops#health-checks#java
Stars21
Forks17
Last commit11 years ago
hypex
hypexElixir

A fast HyperLogLog implementation for Elixir/Erlang that counts unique values with minimal memory usage.

#probabilistic-data-structures#stream-processing#unique-counting
Stars21
Forks3
Last commit6 months ago
DelphiCouchbase
DelphiCouchbasePascal

A Delphi class framework for interacting with Couchbase NoSQL databases, providing CRUD operations, JSON subdocument manipulation, and N1QL query support.

#couchbase#object-pascal#nosql
Stars19
Forks5
Last commit9 years ago
Cascalog
CascalogClojure

A simple wrapper around cascading.hbase for seamless HBase integration in Cascalog workflows.

#cascading#wrapper-library#hbase
Stars19
Forks5
Last commit9 years ago
Sparkling
SparklingScala

A Scala/Spark library for efficient processing, extraction, and derivation of web archive data (CDX/WARC).

#apache-spark#jupyter-integration#cdx
Stars17
Forks2
Last commit2 months ago
adap
adapElixir

A distributed data stream pipeline for querying, augmenting, and transforming data using Elixir pattern-matching rules.

#stream-processing#elixir#distributed-systems
Stars16
Forks2
Last commit9 years ago
TDengine cluster for kubernetes
TDengine cluster for kubernetesShell

Helm charts and Docker Compose configurations for deploying TDengine time-series database clusters on Kubernetes and Docker.

#devops#container-orchestration#database-clustering
Stars16
Forks3
Last commit
SnackFS
SnackFSScala

A lightweight, HDFS-compatible file system built over Cassandra with a fat driver design for easy deployment.

#distributed-filesystem#hdfs-compatible#storage
Stars13
Forks5
Last commit11 years ago
Cascading
CascadingJava

Provides HBase adapters for reading and writing data within Cascading data processing workflows on Hadoop clusters.

#cascading#batch-processing#lingual
Stars10
Forks11
Last commit8 years ago
Tweet Archvies Unleashed Toolkit
Tweet Archvies Unleashed ToolkitScala

An open-source toolkit for analyzing line-oriented JSON Twitter archives using Apache Spark.

#twitter-analysis#apache-spark#spark
Stars10
Forks2
Last commit4 months ago
HadoopConcatGz
HadoopConcatGzJava

A splitable Hadoop InputFormat for processing concatenated GZIP files and web archive (*.warc.gz) data efficiently in distributed systems.

#apache-spark#distributed-processing#java-library
Stars9
Forks2
Last commit8 years ago
kaggle-bestbuy_big
kaggle-bestbuy_bigPython

Code for the Best Buy competition at Kaggle, focusing on mobile contest big data analysis.

#data-science#kaggle-competition#retail-analytics
Stars8
Forks8
Last commit12 years ago
reinvent2015-dev309
reinvent2015-dev309Ruby

Example code for large-scale metrics analysis using Ruby with AWS services like EMR and Redshift.

#mapreduce#metrics-analysis#log-processing
Stars7
Forks2
Last commit8 years ago
spark-connect-csharp
spark-connect-csharpC#

A thin C# gRPC client for communicating with Apache Spark Connect servers, enabling .NET applications to interact with Spark clusters.

#spark-connect#apache-spark#apache
Stars2
Forks0
Last commit2 years ago
sample Spark Job Server Cassandra
sample Spark Job Server CassandraScala

A sample Spark job demonstrating how to use Spark Jobserver to run Apache Spark analytics with Cassandra.

#apache-spark#sample-project#spark-jobserver
Stars2
Forks2
Last commit
PreviousPage 7 of 8Next

Related Tags

Community-curated · Updated weekly · 100% open source

Found a gem we're missing?

Open-Awesome is built by the community, for the community. Submit a project, suggest an awesome list, or help improve the catalog on GitHub.

Submit a projectStar on GitHub
4 years ago
10 months ago
10 years ago
#Data Processing69
#Apache Spark68
#Distributed Computing55
#Hadoop49
#Spark45
#Scala43
#Machine Learning43
#Java38
#Distributed Systems35
#Stream Processing31
#Data Science31
#Data Engineering30