Open-Awesome
CategoriesAlternativesStacksSelf-HostedExplore
Open-Awesome

© 2026 Open-Awesome. Curated for the developer elite.

TermsPrivacyAboutGitHubRSS
  1. Home
  2. Tags
  3. Big Data

Big Data

258 projects

Showing 36 of 258 projects

php-tdengine
php-tdenginePHP

A PHP client extension for the TDengine big data engine, with Swoole coroutine support.

#database-driver#swoole#tdengine-client
Stars78
Forks10
Last commit3 years ago
akela
akelaJava

Mozilla's utility library for Hadoop, HBase, Pig, and related big data technologies.

#mapreduce#hbase#java
Stars77
Forks31
Last commit12 years ago
Beetest
BeetestJava

A simple utility for testing Apache Hive scripts locally without requiring Java development skills.

#unit-testing#apache-hive#data-engineering
Stars73
Forks24
Last commit9 years ago
count-min-log
count-min-logGo

Go implementation of Count-Min-Log sketch for improved approximate counting of low-frequency events.

#probabilistic-data-structures#stream-processing#go-library
Stars70
Forks6
Last commit1 year ago
Hive_test
Hive_testJava

A unit test framework for Hive scripts that provides an embedded Hive environment with Derby database and HiveThriftService.

#unit-testing#apache-hive#java
Stars65
Forks47
Last commit4 years ago
emr-sample-apps
emr-sample-appsJava

Code samples demonstrating how to use popular applications on Amazon Elastic MapReduce (EMR).

#mapreduce#educational#code-samples
Stars63
Forks51
Last commit11 years ago
Map/Reduce implementations of common ML algorithms
Map/Reduce implementations of common ML algorithmsJupyter Notebook

Jupyter notebooks for hands-on Big Data Analytics exercise classes covering Spark ML, Map/Reduce algorithms, and deep learning.

#spark#educational#data-science
Stars62
Forks27
Last commit
json-streamer
json-streamerRuby

A Ruby gem for extracting data from JSON streams based on keys, nesting levels, or custom conditions without implementing low-level callbacks.

#stream-processing#event-driven#json-stream
Stars60
Forks9
Last commit1 month ago
diver
diverJava

An Erlang/Elixir driver for HBase that uses a Java server with Asynchbase to provide asynchronous database queries.

#elixir#hbase#distributed-systems
Stars51
Forks7
Last commit10 years ago
s4
s4Java

A distributed platform for processing continuous unbounded streams of data with a clean API and fault tolerance.

#stream-processing#event-processing#real-time-analytics
Stars43
Forks16
Last commit7 years ago
Elasticsearch
ElasticsearchJava

An Elasticsearch river plugin for importing data from HBase into Elasticsearch.

#search-indexing#distributed-storage#data-integration
Stars39
Forks35
Last commit12 years ago
EtlBox.Classic
EtlBox.ClassicC#

A lightweight ETL library and data integration toolbox for .NET, enabling programmatic data flow pipelines.

#database#data-integration#csharp
Stars36
Forks14
Last commit9 days ago
Impala
ImpalaC++

A massively-parallel C++ SQL query engine for lightning-fast analytics on petabytes of data in Hadoop clusters.

#real-time-queries#sql-query-engine#c-plus-plus
Stars34
Forks32
Last commit3 years ago
hdfs-rs
hdfs-rsRust

Rust bindings and safe wrapper APIs for Hadoop's libhdfs, enabling HDFS access from Rust applications.

#distributed-storage#ffi#rust-bindings
Stars31
Forks10
Last commit11 years ago
clusterdock
clusterdockPython

clusterdock is a framework for creating Docker-based container clusters

#docker#big-data#hadoop
Stars30
Forks8
Last commit3 years ago
Archives Unleashed Notebooks
Archives Unleashed NotebooksJupyter Notebook

Example notebooks for analyzing web archives using the Archives Unleashed Toolkit.

#web-archives#spark#pyspark-notebook
Stars26
Forks5
Last commit3 years ago
Hugegraph/Hugegraph
Hugegraph/HugegraphJava

A fast, highly-scalable graph database supporting over 10 billion vertices and edges with OLTP capabilities and dual Gremlin/Cypher query language support.

#raft-consensus#java#gremlin
Stars26
Forks3
Last commit2 days ago
DelphiCassandra
DelphiCassandraPascal

A Delphi framework for connecting to and performing CRUD operations on Apache Cassandra databases using the DataStax C/C++ driver.

#nosql#database-client#datastax-driver
Stars25
Forks9
Last commit9 years ago
Spark Cassandra Stress
Spark Cassandra StressScala

A tool for testing the DataStax Spark Connector against Apache Cassandra or DataStax Enterprise.

#gradle#stress-testing#testing-tool
Stars25
Forks12
Last commit3 years ago
vessel
vesselElixir

An Elixir MapReduce framework with Hadoop Streaming integration, simplifying distributed data processing.

#mapreduce#elixir#mix-tasks
Stars24
Forks1
Last commit5 years ago
sample KafkaSparkCassandra
sample KafkaSparkCassandraScala

A Scala sample application demonstrating Spark Streaming integration with Kafka and Cassandra for data processing.

#apache-spark#real-time-analytics#scala
Stars22
Forks23
Last commit7 years ago
ankush
ankushJava

A big data cluster management tool that creates and manages multi-technology clusters with health monitoring.

#devops#health-checks#java
Stars21
Forks17
Last commit11 years ago
hypex
hypexElixir

A fast HyperLogLog implementation for Elixir/Erlang that counts unique values with minimal memory usage.

#probabilistic-data-structures#stream-processing#unique-counting
Stars21
Forks3
Last commit7 months ago
DelphiCouchbase
DelphiCouchbasePascal

A Delphi class framework for interacting with Couchbase NoSQL databases, providing CRUD operations, JSON subdocument manipulation, and N1QL query support.

#couchbase#object-pascal#nosql
Stars19
Forks5
Last commit9 years ago
Cascalog
CascalogClojure

A simple wrapper around cascading.hbase for seamless HBase integration in Cascalog workflows.

#cascading#wrapper-library#hbase
Stars19
Forks5
Last commit9 years ago
Sparkling
SparklingScala

A Scala/Spark library for efficient processing, extraction, and derivation of web archive data (CDX/WARC).

#apache-spark#jupyter-integration#cdx
Stars17
Forks2
Last commit3 months ago
adap
adapElixir

A distributed data stream pipeline for querying, augmenting, and transforming data using Elixir pattern-matching rules.

#stream-processing#elixir#distributed-systems
Stars16
Forks2
Last commit9 years ago
TDengine cluster for kubernetes
TDengine cluster for kubernetesShell

Helm charts and Docker Compose configurations for deploying TDengine time-series database clusters on Kubernetes and Docker.

#devops#container-orchestration#database-clustering
Stars16
Forks3
Last commit
SnackFS
SnackFSScala

A lightweight, HDFS-compatible file system built over Cassandra with a fat driver design for easy deployment.

#distributed-filesystem#hdfs-compatible#storage
Stars13
Forks5
Last commit11 years ago
Cascading
CascadingJava

Provides HBase adapters for reading and writing data within Cascading data processing workflows on Hadoop clusters.

#cascading#batch-processing#lingual
Stars10
Forks11
Last commit8 years ago
Tweet Archvies Unleashed Toolkit
Tweet Archvies Unleashed ToolkitScala

An open-source toolkit for analyzing line-oriented JSON Twitter archives using Apache Spark.

#twitter-analysis#apache-spark#spark
Stars10
Forks2
Last commit5 months ago
HadoopConcatGz
HadoopConcatGzJava

A splitable Hadoop InputFormat for processing concatenated GZIP files and web archive (*.warc.gz) data efficiently in distributed systems.

#apache-spark#distributed-processing#java-library
Stars9
Forks2
Last commit8 years ago
kaggle-bestbuy_big
kaggle-bestbuy_bigPython

Code for the Best Buy competition at Kaggle, focusing on mobile contest big data analysis.

#data-science#kaggle-competition#retail-analytics
Stars8
Forks8
Last commit12 years ago
reinvent2015-dev309
reinvent2015-dev309Ruby

Example code for large-scale metrics analysis using Ruby with AWS services like EMR and Redshift.

#mapreduce#metrics-analysis#log-processing
Stars7
Forks2
Last commit8 years ago
spark-connect-csharp
spark-connect-csharpC#

A thin C# gRPC client for communicating with Apache Spark Connect servers, enabling .NET applications to interact with Spark clusters.

#spark-connect#apache-spark#apache
Stars2
Forks0
Last commit2 years ago
sample Spark Job Server Cassandra
sample Spark Job Server CassandraScala

A sample Spark job demonstrating how to use Spark Jobserver to run Apache Spark analytics with Cassandra.

#apache-spark#sample-project#spark-jobserver
Stars2
Forks2
Last commit
PreviousPage 7 of 8Next

Related Tags

Community-curated · Updated weekly · 100% open source

Found a gem we're missing?

Open-Awesome is built by the community, for the community. Submit a project, suggest an awesome list, or help improve the catalog on GitHub.

Submit a projectStar on GitHub
4 years ago
11 months ago
10 years ago
#Data Processing69
#Apache Spark68
#Distributed Computing55
#Hadoop49
#Spark45
#Scala43
#Machine Learning43
#Java38
#Distributed Systems35
#Stream Processing31
#Data Science31
#Data Engineering30