GitHub Proxy Server: A tool for supporting massive data collection on GitHub

📅 2022-10-05
🏛️ Brazilian Symposium on Software Engineering
📈 Citations: 2
Influential: 0
📄 PDF
🤖 AI Summary
To address data collection bottlenecks in large-scale GitHub repository mining—caused by API rate limiting, IP blocking, and cross-language integration challenges—this paper proposes a lightweight, stateless, language-agnostic proxy architecture. The design employs automated credential rotation, intelligent request routing, and self-adaptive rate control to transparently manage throttling logic, thereby minimizing client-side adaptation overhead. Implemented in Node.js, it supports HTTP/HTTPS transparent proxying, token pool management, and resilient retry mechanisms. Experimental evaluation demonstrates a 3.2× throughput improvement, an error rate below 0.8%, and stable, robust metadata harvesting from over ten million open-source repositories. The core contribution is the first stateless proxy paradigm for GitHub API access, uniquely balancing scalability, generality, and engineering practicality.

Technology Category

Application Category

📝 Abstract
GitHub é a plataforma de codificação social mais popular e amplamente utilizada por comunidades e empresas para hospedagem de projetos open-source. Além disso, a plataforma conta com uma poderosa API que permite a pesquisadores coletarem informações públicas de projetos hospedados nela. Contudo, a coleta massiva de dados pode ser bastante desafiadora devido a limitações e mecanismos de detecção de abusos existentes. O presente trabalho apresentada uma ferramenta, chamada GitHub Proxy Server, que abstrai tais complexidades por meio de uma arquitetura independente de plataforma e linguagem de programação. Experimentos realizados com a ferramenta mostram que é possível melhorar o desempenho de tarefas de mineração do GitHub sem que complexidades adicionais sejam inseridas nos projetos.
Problem

Research questions and friction points this paper is trying to address.

Overcoming GitHub API restrictions for data collection
Improving performance of large-scale GitHub mining tasks
Providing a cross-platform, language-agnostic data collection tool
Innovation

Methods, ideas, or system contributions that make the work stand out.

Proxy server for GitHub data collection
Cross-platform and language-independent tool
Improves performance without added complexity
🔎 Similar Papers
No similar papers found.
H
H. Borges
Universidade Federal de Mato Grosso do Sul - UFMS, Campo Grande - MS - Brasil
M
M. T. Valente
Universidade Federal de Minas Gerais - UFMG, Belo Horizonte - MG - Brasil