CoolFace
Datasetpublic

IuryCavalcante/TechnicalDebt_GitHubIssues_PT

Technical Debt in GitHub Issues (Portuguese) Visão Geral Este dataset reúne issues públicas extraídas do GitHub que mencionam o termo "dívida técnica" ou suas variações em português. A base foi construída com o objetivo de apoiar pesquisas em Engenharia de Software, Processamento de Linguagem Natural (PLN) e Inteligência Artificial, com foco na compreensão e classificação de como o conceito de dívida técnica é comunicado por desenvolvedores. A estrutura e… See the full description on the dataset page: https://huggingface.co/datasets/IuryCavalcante/TechnicalDebt_GitHubIssues_PT.

sourceHugging Facecc-by-4.0updated 1y agoView on Hugging Face
0likes26downloads
Dataset Card

Technical Debt in GitHub Issues (Portuguese)

Visão Geral

Este dataset reúne issues públicas extraídas do GitHub que mencionam o termo "dívida técnica" ou suas variações em português. A base foi construída com o objetivo de apoiar pesquisas em Engenharia de Software, Processamento de Linguagem Natural (PLN) e Inteligência Artificial, com foco na compreensão e classificação de como o conceito de dívida técnica é comunicado por desenvolvedores.

A estrutura e categorização dos dados foram definidas a partir de uma análise qualitativa realizada no contexto de um estudo acadêmico, visando treinar modelos de classificação textual e explorar o uso do termo na prática profissional.

Estrutura do Dataset

Cada linha do dataset representa uma issue e contém os seguintes campos:

  • ID: Identificador único da issue no GitHub
  • Data: Data de criação ou atualização da issue
  • Título: Título da issue
  • Link: URL direta para a issue no GitHub
  • Descrição: Texto completo da issue (incluindo descrição e, quando aplicável, comentários)
  • # watching: Número de usuários acompanhando a issue
  • # star: Número de estrelas do repositório
  • Status: Status da issue (ex: open, closed)
  • Repositório: Nome do repositório de origem
  • Contexto de uso: Classificação que emergiu de forma indutiva, conforme artigo *1
  • Categoria: Classificação que emergiu de forma indutiva, conforme artigo *1
*1 - As classificações Contexto de uso e Categoria são fruto de uma análise qualitativa realizada com esse dataset de issues. Para mais detalhes acesse o artigo completo.
2 - A base não contém informações sensíveis ou privadas e se restringe a repositórios públicos.

Aplicações e Uso

Este dataset é ideal para tarefas de:

  • Classificação de texto supervisionada
  • Análise qualitativa e quantitativa do uso de conceitos técnicos
  • Treinamento de modelos de PLN em português técnico
  • Estudos sobre comunicação de dívida técnica em ambientes colaborativos

Licença

Este dataset está licenciado sob CC BY 4.0, permitindo o uso, redistribuição e adaptação com atribuição apropriada.

Citação sugerida

Se utilizar este dataset, por favor cite: