CoolFace
Datasetpublic

costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01

OpenAI Terra Batch — Wikipédia PT-BR (run parcial) Checkpoint publicável de uma execução real e interrompida do fluxo document_task_matrix. A execução planejou gerar uma matriz de 1.000 documentos da Wikipédia em português por 25 tasks canônicas usando a Responses API Batch e o modelo gpt-5.6-terra. Este repositório não representa a conclusão dos 25.000 pares planejados. Ele contém somente os 1.282 candidatos aceitos após a reconciliação offline de todos os resultados Batch já… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes132downloads
Dataset Card

OpenAI Terra Batch — Wikipédia PT-BR (run parcial)

Checkpoint publicável de uma execução real e interrompida do fluxo document_task_matrix. A execução planejou gerar uma matriz de 1.000 documentos da Wikipédia em português por 25 tasks canônicas usando a Responses API Batch e o modelo gpt-5.6-terra.

Este repositório não representa a conclusão dos 25.000 pares planejados. Ele contém somente os 1.282 candidatos aceitos após a reconciliação offline de todos os resultados Batch já pagos. Nenhuma nova chamada foi despachada durante essa reconciliação.

Resultado publicado

  • —status da run: interrupted
  • —documentos selecionados: 1.000 de 1.614 elegíveis
  • —pares planejados: 25.000
  • —chamadas despachadas: 1.800
  • —resultados locais terminalizados: 1.800
  • —pares distintos que receberam uma chamada: 1.392
  • —exemplos aceitos e publicados: 1.282
  • —pares pulados por fonte insuficiente: 39
  • —pares esgotados após três tentativas: 40
  • —pares restantes no relatório: 23.639
  • —documentos com alguma chamada: 56
  • —documentos com ao menos um exemplo aceito: 56
  • —backend: openai_api
  • —modalidade: Responses API Batch
  • —modelo: gpt-5.6-terra

Cada exemplo publicado contém uma conversa com exatamente as roles system, user e assistant. O trecho integral usado como contexto de geração permanece oculto; o formato canônico e os formatos de treino retêm apenas as evidências necessárias para auditoria.

Tasks

TaskAceitos
definition56
closed_qa54
summarization56
information_extraction54
comparison54
classification56
timeline41
rewrite56
concept_explanation56
structured_extraction56
fact_checking55
taxonomy54
short_answer53
didactic_explanation55
reasoning55
multiple_choice_exact48
binary_qa_exact55
textual_entailment55
semantic_similarity55
extractive_qa55
causal_multiple_choice20
brazilian_cultural_choice40
fact_verification_exact55
sentiment_exact46
intent_classification42

Interrupção e reconciliação

A OpenAI retornou 1.796 das 1.800 chamadas despachadas. Dezessete batches terminaram e um foi cancelado depois de concluir 96 de 100 requisições. O banco local havia incorporado 1.400 respostas quando a execução foi interrompida.

As 396 respostas remotas restantes foram reconciliadas sem novo despacho e as quatro requisições não executadas foram registradas como erros de cancelamento. A reconciliação acrescentou 158 candidatos aceitos. Também finalizou 162 respostas tardias como superseded, pois seus slots já estavam aceitos ou pulados por outra tentativa.

O custo reconciliado diretamente pelo usage das 1.796 respostas remotas foi de US$ 41,516456. O usage faturável de 80 respostas interrompidas por max_output_tokens também foi preservado. Não há custo reservado nem tentativa inflight restante.

Aprovação por tentativa

Taxa calculada como candidatos aceitos divididos pelas chamadas executadas naquele número de tentativa:

TentativaChamadasAceitosTaxa
11.3921.00972,49%
233624773,51%
3722636,11%

Considerando os 1.392 pares distintos que receberam uma primeira chamada, a aprovação acumulada chegou a 90,23% após a segunda tentativa e 92,10% após a terceira.

Formatos

  • —messages: conversa pronta para SFT, com três roles;
  • —prompt_completion: prompt e completion;
  • —alpaca: instruction, input e output;
  • —canonical: candidato completo, com task, dificuldade, evidências e metadados de geração.

Os quatro formatos representam os mesmos 1.282 exemplos aceitos. Skips, rejeições, requests da API, respostas brutas, source_excerpt, banco SQLite, arquivos Batch e o corpus local não fazem parte da publicação.

Proveniência e limitações

Os exemplos são sintéticos e derivados de um snapshot local de artigos da Wikipédia em português. Consulte o dataset-fonte e a Wikipédia para atribuição, licenciamento e verificação dos fatos.

Esta é uma execução parcial, não um benchmark de qualidade e não uma produção concluída. Os candidatos foram aceitos pelos validadores automáticos da pipeline, mas ainda devem passar por revisão amostral humana antes de uso em treinamento de produção.

Os artefatos em metadata/ preservam a configuração, o plano v3, o relatório, o progresso, o manifesto e o resumo de reconciliação usados nesta publicação.