CoolFace
Datasetpublic

BernardoAI/wpp_pav_transcrito_gemini

🎤 Transcrições WhatsApp - Google Gemini 2.0 Flash Este dataset contém transcrições de mensagens de áudio do WhatsApp geradas usando Google Gemini 2.0 Flash. 📋 Descrição Origem: Mensagens de áudio do WhatsApp em português brasileiro Modelo: Google Gemini 2.0 Flash Preço: $0.075/1M tokens Total de amostras: 198 Formato de áudio: WAV (16kHz) Idioma: Português brasileiro Modelo de IA multimodal avançado da Google com capacidades de análise contextual de áudio.… See the full description on the dataset page: https://huggingface.co/datasets/BernardoAI/wpp_pav_transcrito_gemini.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes15downloads
Dataset Card

🎤 Transcrições WhatsApp - Google Gemini 2.0 Flash

Este dataset contém transcrições de mensagens de áudio do WhatsApp geradas usando Google Gemini 2.0 Flash.

📋 Descrição

  • —Origem: Mensagens de áudio do WhatsApp em português brasileiro
  • —Modelo: Google Gemini 2.0 Flash
  • —Preço: $0.075/1M tokens
  • —Total de amostras: 198
  • —Formato de áudio: WAV (16kHz)
  • —Idioma: Português brasileiro

Modelo de IA multimodal avançado da Google com capacidades de análise contextual de áudio.

🗂️ Estrutura do Dataset

CampoTipoDescrição
audioAudioArquivo de áudio WAV original
file_namestringNome do arquivo de áudio
original_textstringTexto de referência original
transcriptionstringTranscrição gerada pelo modelo
modelstringIdentificador do modelo usado
latency_secondsfloatTempo de processamento em segundos
estimated_cost_usdfloatCusto estimado em USD

🎯 Uso

python
from datasets import load_dataset

# Carregar dataset
dataset = load_dataset("BernardoAI/wpp_pav_transcrito_gemini")

# Acessar uma amostra
sample = dataset['train'][0]
print(f"Transcrição: {sample['transcription']}")

# Reproduzir áudio (Jupyter)
import IPython.display as ipd
ipd.Audio(sample['audio']['array'], rate=sample['audio']['sampling_rate'])

🔄 Comparação com Outros Modelos

Este dataset faz parte de uma série de comparações entre diferentes APIs de transcrição:

  • —`wpp_pav_transcrito_gemini` - Google Gemini 2.0 Flash
  • —`wpp_pav_transcrito_openai` - OpenAI GPT-4o Transcribe
  • —`wpp_pav_transcrito_deepgram` - Deepgram Nova 2

📊 Análise de Performance

Para análise comparativa entre modelos:

python
import polars as pl

# Carregar múltiplos datasets para comparação
datasets = ['gemini', 'openai', 'deepgram']
dfs = {}

for model in datasets:
    ds = load_dataset(f"BernardoAI/wpp_pav_transcrito_{model}")
    dfs[model] = pl.DataFrame(ds['train'].to_pandas())

# Comparar latências
for model, df in dfs.items():
    latencia_media = df['latency_seconds'].mean()
    print(f"{model.title()}: {latencia_media:.2f}s")

# Comparar custos
for model, df in dfs.items():
    custo_total = df['estimated_cost_usd'].sum()
    print(f"{model.title()}: ${custo_total:.6f}")

🏷️ Citação

Se você usar este dataset em pesquisa, por favor cite:

bibtex
@dataset{wpp_transcricoes_gemini,
  title={Transcrições WhatsApp - Google Gemini 2.0 Flash},
  author={Sistema de Transcrição Automatizada},
  year={2025},
  url={https://huggingface.co/datasets/BernardoAI/wpp_pav_transcrito_gemini}
}

📄 Licença

MIT License - Livre para uso comercial e acadêmico.

🤝 Contribuições

Criado como parte do projeto de comparação de APIs de transcrição. Feedback e sugestões são bem-vindos!


Gerado automaticamente em 25/06/2025 00:53:21