costadev00/smoke-openai-terra-batch-brasil-25-20260724-01
Smoke OpenAI Terra Batch — Brasil × 25 tasks Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 resultados reais do backend: 27 retries com nova chamada: 2 backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.
Smoke OpenAI Terra Batch — Brasil × 25 tasks
Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial.
Resultado
- status:
completed - documentos: 1
- pares planejados: 25
- exemplos aceitos: 25
- pares pulados: 0
- pares esgotados: 0
- resultados reais do backend: 27
- retries com nova chamada: 2
- backend:
openai_api - modalidade: Responses API Batch
- modelo:
gpt-5.6-terra - custo calculado pelo usage: US$ 0,453900
- tokens de entrada: 602.472
- tokens de entrada em cache: 580.253
- cache hit rate: 96,312%
- tokens de saída: 47.146
- reasoning tokens reportados: 41.647
Três batches remotos foram processados, sem requests remotamente falhos. Uma retomada posterior preservou exatamente 27 resultados e três batches, sem duplicar chamadas.
Tasks e tentativas
Algumas tentativas reservadas foram liberadas antes do despacho pelo controle de orçamento; por isso a contagem durável do slot pode ser maior que a quantidade de resultados pagos do backend.
Formatos
messages: conversas com exatamente as rolessystem,usereassistant;prompt_completion: prompt e completion;alpaca:instruction,inputeoutput;canonical: candidatos completos, incluindo task, dificuldade, evidências e metadados de geração.
Somente candidatos aceitos aparecem nesses arquivos. Requests da API, source_excerpt, banco SQLite, corpus local e arquivos brutos de Batch não fazem parte desta publicação.
Validação
Todos os 25 payloads aceitos foram novamente validados contra o documento selecionado. A auditoria verificou:
- plano v3 e unicidade dos 25 pares documento–task;
- backend
openai_api, modalidade Batch e modelo fixo; - exatamente as roles
system,usereassistant; - contratos de respostas exatas;
- spans extrativos literais;
- evidências e offsets;
- formato
<think>...</think>somente emreasoning; - ausência de slots pending ou exhausted;
- conciliação do custo dos resultados com os batches remotos;
- igualdade dos contadores antes e depois de
resume.
Os artefatos de auditoria ficam em metadata/: configuração resolvida, plano, manifesto, relatório final e generation_info.json.
Reprodução
RUN=runs/openai-smoke-batch-gpt-5.6-terra-brasil-25-<novo-id>
.venv/bin/sft-dataset plan \
--config smoke/openai-smoke-gpt-5.6-terra-batch-brasil.json \
--run-dir "$RUN"
.venv/bin/sft-dataset run --plan "$RUN/plan.json"
.venv/bin/sft-dataset run --resume "$RUN"
.venv/bin/python smoke/verify_openai_batch_run.py "$RUN"Origem e limitações
O exemplo deriva do registro id=0, título Brasil, do snapshot local criado a partir de costadev00/wiki-brazil. Consulte o dataset-fonte e a Wikipédia para termos de atribuição e licenciamento.
Este repositório é um smoke test de integração com somente 25 exemplos. Ele serve para auditoria da pipeline e não constitui um benchmark de qualidade nem um corpus suficiente para treinamento isolado. As respostas são sintéticas e devem ser revisadas antes de uso em produção.
