🤖 AI Summary
To address data collection bottlenecks in large-scale GitHub repository mining—caused by API rate limiting, IP blocking, and cross-language integration challenges—this paper proposes a lightweight, stateless, language-agnostic proxy architecture. The design employs automated credential rotation, intelligent request routing, and self-adaptive rate control to transparently manage throttling logic, thereby minimizing client-side adaptation overhead. Implemented in Node.js, it supports HTTP/HTTPS transparent proxying, token pool management, and resilient retry mechanisms. Experimental evaluation demonstrates a 3.2× throughput improvement, an error rate below 0.8%, and stable, robust metadata harvesting from over ten million open-source repositories. The core contribution is the first stateless proxy paradigm for GitHub API access, uniquely balancing scalability, generality, and engineering practicality.
📝 Abstract
GitHub é a plataforma de codificação social mais popular e amplamente utilizada por comunidades e empresas para hospedagem de projetos open-source. Além disso, a plataforma conta com uma poderosa API que permite a pesquisadores coletarem informações públicas de projetos hospedados nela. Contudo, a coleta massiva de dados pode ser bastante desafiadora devido a limitações e mecanismos de detecção de abusos existentes. O presente trabalho apresentada uma ferramenta, chamada GitHub Proxy Server, que abstrai tais complexidades por meio de uma arquitetura independente de plataforma e linguagem de programação. Experimentos realizados com a ferramenta mostram que é possível melhorar o desempenho de tarefas de mineração do GitHub sem que complexidades adicionais sejam inseridas nos projetos.