CoolFace
Datasetpublic

costadev00/smoke-openai-terra-batch-brasil-25-20260724-01

Smoke OpenAI Terra Batch — Brasil × 25 tasks Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 resultados reais do backend: 27 retries com nova chamada: 2 backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes54downloads
Dataset Card

Smoke OpenAI Terra Batch — Brasil × 25 tasks

Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial.

Resultado

  • —status: completed
  • —documentos: 1
  • —pares planejados: 25
  • —exemplos aceitos: 25
  • —pares pulados: 0
  • —pares esgotados: 0
  • —resultados reais do backend: 27
  • —retries com nova chamada: 2
  • —backend: openai_api
  • —modalidade: Responses API Batch
  • —modelo: gpt-5.6-terra
  • —custo calculado pelo usage: US$ 0,453900
  • —tokens de entrada: 602.472
  • —tokens de entrada em cache: 580.253
  • —cache hit rate: 96,312%
  • —tokens de saída: 47.146
  • —reasoning tokens reportados: 41.647

Três batches remotos foram processados, sem requests remotamente falhos. Uma retomada posterior preservou exatamente 27 resultados e três batches, sem duplicar chamadas.

Tasks e tentativas

TaskStatusTentativas do slotResultados do backend
definitionaccepted11
closed_qaaccepted11
summarizationaccepted11
information_extractionaccepted11
comparisonaccepted11
classificationaccepted11
timelineaccepted11
rewriteaccepted11
concept_explanationaccepted11
structured_extractionaccepted11
fact_checkingaccepted11
taxonomyaccepted11
short_answeraccepted11
didactic_explanationaccepted11
reasoningaccepted11
multiple_choice_exactaccepted11
binary_qa_exactaccepted21
textual_entailmentaccepted21
semantic_similarityaccepted21
extractive_qaaccepted21
causal_multiple_choiceaccepted32
brazilian_cultural_choiceaccepted32
fact_verification_exactaccepted21
sentiment_exactaccepted21
intent_classificationaccepted21

Algumas tentativas reservadas foram liberadas antes do despacho pelo controle de orçamento; por isso a contagem durável do slot pode ser maior que a quantidade de resultados pagos do backend.

Formatos

  • —messages: conversas com exatamente as roles system, user e assistant;
  • —prompt_completion: prompt e completion;
  • —alpaca: instruction, input e output;
  • —canonical: candidatos completos, incluindo task, dificuldade, evidências e metadados de geração.

Somente candidatos aceitos aparecem nesses arquivos. Requests da API, source_excerpt, banco SQLite, corpus local e arquivos brutos de Batch não fazem parte desta publicação.

Validação

Todos os 25 payloads aceitos foram novamente validados contra o documento selecionado. A auditoria verificou:

  • —plano v3 e unicidade dos 25 pares documento–task;
  • —backend openai_api, modalidade Batch e modelo fixo;
  • —exatamente as roles system, user e assistant;
  • —contratos de respostas exatas;
  • —spans extrativos literais;
  • —evidências e offsets;
  • —formato <think>...</think> somente em reasoning;
  • —ausência de slots pending ou exhausted;
  • —conciliação do custo dos resultados com os batches remotos;
  • —igualdade dos contadores antes e depois de resume.

Os artefatos de auditoria ficam em metadata/: configuração resolvida, plano, manifesto, relatório final e generation_info.json.

Reprodução

bash
RUN=runs/openai-smoke-batch-gpt-5.6-terra-brasil-25-<novo-id>

.venv/bin/sft-dataset plan \
  --config smoke/openai-smoke-gpt-5.6-terra-batch-brasil.json \
  --run-dir "$RUN"

.venv/bin/sft-dataset run --plan "$RUN/plan.json"
.venv/bin/sft-dataset run --resume "$RUN"
.venv/bin/python smoke/verify_openai_batch_run.py "$RUN"

Origem e limitações

O exemplo deriva do registro id=0, título Brasil, do snapshot local criado a partir de costadev00/wiki-brazil. Consulte o dataset-fonte e a Wikipédia para termos de atribuição e licenciamento.

Este repositório é um smoke test de integração com somente 25 exemplos. Ele serve para auditoria da pipeline e não constitui um benchmark de qualidade nem um corpus suficiente para treinamento isolado. As respostas são sintéticas e devem ser revisadas antes de uso em produção.