CoolFace
Datasetpublic

pageman/philippine-budget-2025-embeddings-mpnet

Philippine Budget 2025 - Vector Embeddings (all-mpnet-base-v2) Dataset Description This dataset contains vector embeddings of the 2025 People's Budget of the Philippines, a citizen-friendly overview of the PHP 6.326 trillion national budget published by the Department of Budget and Management (DBM). Source Document These embeddings are based on the 2025 People's Enacted Budget (English version, revised as of April 22, 2025). Direct Download Link:… See the full description on the dataset page: https://huggingface.co/datasets/pageman/philippine-budget-2025-embeddings-mpnet.

sourceHugging Facecc-by-4.0updated 11mo agoView on Hugging Face
0likes22downloads
Dataset Card

Philippine Budget 2025 - Vector Embeddings (all-mpnet-base-v2)

Dataset Description

This dataset contains vector embeddings of the 2025 People's Budget of the Philippines, a citizen-friendly overview of the PHP 6.326 trillion national budget published by the Department of Budget and Management (DBM).

Source Document

These embeddings are based on the 2025 People's Enacted Budget (English version, revised as of April 22, 2025).

Direct Download Link: 2025 People's Enacted Budget PDF

This 100+ page PDF provides a citizen-friendly overview of the PHP 6.326 trillion national budget, including:

  • —Sector breakdowns
  • —Priorities like Education (PHP 977.6B)
  • —Infrastructure (PHP 1.507T)
  • —Health, Social Protection, Food Security, and more

A Filipino version is also available via the DBM website.

Model Information

  • —Embedding Model: all-mpnet-base-v2
  • —Embedding Dimensions: 768
  • —Description: High quality (768 dimensions)
  • —Total Embeddings: 55
  • —Library: sentence-transformers
  • —Generated: 2025-10-18T11:41:09.087275

Quality Metrics

  • —Normalization: L2 normalized (all vectors have norm = 1.0)
  • —Sparsity: 0.39% (very dense embeddings)
  • —Dimension Efficiency: 80.04%
  • —Processing Speed: 18.12 seconds for 55 chunks

Dataset Structure

Data Fields

FieldTypeDescription
chunk_idstringUnique identifier for each chunk (e.g., "chunk_0000")
pageint32Page number in the original document (1-55)
textstringOriginal text content from the budget document
embeddingfloat32[768]Vector embedding (768 dimensions)
sectionstringDocument section (e.g., "SPENDING PRIORITIES")
word_countint32Number of words in the chunk
estimated_tokensint32Estimated token count for the chunk

Data Splits

This dataset contains a single split (train) with 55 examples.

Document Coverage

The embeddings cover all major sections of the Philippine Budget 2025:

  • —✅ Budget Dimensions: By sector (traditional and COFOG), expense class, recipient unit, region, special purpose fund, appropriation source
  • —✅ Spending Priorities: Education, Health, Social Protection, Food Security, Industry/Workforce/Tourism, Science & Technology, Infrastructure, Peace & Order, Governance, Environment
  • —✅ Financing: The 2025 Budget and the Economy, Fiscal Program, Revenues, Borrowings
  • —✅ Budget Basics: Budget Cycle, Glossary, Ask Your Government, Off-Budget Accounts

Usage

Load the Dataset

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-mpnet")

# Access embeddings
embeddings = dataset['train']['embedding']
texts = dataset['train']['text']
pages = dataset['train']['page']

print(f"Loaded {len(embeddings)} embeddings with {len(embeddings[0])} dimensions")

Semantic Search Example

python
from datasets import load_dataset
from sentence_transformers import SentenceTransformer
import numpy as np
from sklearn.metrics.pairwise import cosine_similarity

# Load dataset and model
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-mpnet")
model = SentenceTransformer('all-mpnet-base-v2')

# Get embeddings
doc_embeddings = np.array(dataset['train']['embedding'])
texts = dataset['train']['text']

# Search
query = "What is the education budget allocation?"
query_embedding = model.encode(query)
similarities = cosine_similarity([query_embedding], doc_embeddings)[0]

# Get top 5 results
top_indices = np.argsort(similarities)[-5:][::-1]
for idx in top_indices:
    print(f"Score: {similarities[idx]:.4f}")
    print(f"Page: {dataset['train']['page'][idx]}")
    print(f"Text: {texts[idx][:200]}...")
    print()

Use with ChromaDB

python
import chromadb
from datasets import load_dataset

# Load dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-mpnet")

# Initialize ChromaDB
client = chromadb.Client()
collection = client.create_collection("philippine_budget")

# Add to collection
collection.add(
    ids=[item['chunk_id'] for item in dataset['train']],
    embeddings=[item['embedding'] for item in dataset['train']],
    documents=[item['text'] for item in dataset['train']],
    metadatas=[{'page': item['page'], 'section': item['section']} for item in dataset['train']]
)

# Query
results = collection.query(
    query_texts=["infrastructure spending priorities"],
    n_results=5
)
print(results)

Use with LangChain (RAG)

python
from langchain.vectorstores import Chroma
from langchain.embeddings import HuggingFaceEmbeddings
from datasets import load_dataset

# Load dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-mpnet")

# Create embeddings
embeddings = HuggingFaceEmbeddings(model_name='all-mpnet-base-v2')

# Create vector store
texts = dataset['train']['text']
metadatas = [{'page': p, 'section': s} for p, s in zip(
    dataset['train']['page'], 
    dataset['train']['section']
)]

vectorstore = Chroma.from_texts(
    texts=texts,
    embedding=embeddings,
    metadatas=metadatas
)

# Use as retriever
retriever = vectorstore.as_retriever(search_kwargs={"k": 5})
docs = retriever.get_relevant_documents("healthcare funding")

Model Comparison

ModelDimensionsSpeedQualityFile SizeBest For
all-MiniLM-L6-v2384⭐⭐⭐⭐⭐ Fast⭐⭐⭐⭐ Good0.70 MBGeneral use, real-time search
all-mpnet-base-v2768⭐⭐⭐ Moderate⭐⭐⭐⭐⭐ Excellent1.31 MBHigh-precision, research

When to Use This Model

Use all-mpnet-base-v2 when:

  • —✅ You need maximum accuracy and semantic understanding
  • —✅ You're doing complex document analysis
  • —✅ Accuracy is more important than speed
  • —✅ You're building research or analytical tools
  • —✅ You need fine-grained similarity detection

Use Cases

1. Semantic Search Portal

Build a citizen-friendly search interface for budget information:

python
query = "How much is allocated for public schools?"
# Returns relevant budget sections with similarity scores

2. Budget Q&A Chatbot (RAG)

Create an AI assistant that answers budget questions using retrieval-augmented generation.

3. Policy Analysis Tool

Enable researchers to quickly find and analyze budget allocations across sectors and regions.

4. Budget Comparison System

Compare spending priorities across different fiscal years or government departments.

5. Transparency Dashboard

Build interactive visualizations with semantic filtering and exploration.

Source Document Details

  • —Title: AGENDA FOR PROSPERITY: Fulfilling the Needs and Aspirations of the Filipino People
  • —Publisher: Department of Budget and Management (DBM), Philippines
  • —Fiscal Year: 2025
  • —Total Budget: PHP 6.326 trillion (22.1% of GDP)
  • —Document Type: People's Enacted Budget (Citizen-friendly version)
  • —Pages: 55
  • —Last Revised: April 22, 2025
  • —Languages Available: English, Filipino

Key Budget Highlights

  • —Education: PHP 977.6 billion (highest allocation)
  • —Infrastructure: PHP 1.507 trillion
  • —Health: Substantial allocations for universal healthcare
  • —Social Protection: Programs for vulnerable sectors
  • —Food Security: Agricultural and agribusiness support

Technical Specifications

Chunking Strategy

  • —Method: Semantic units with 20% overlap
  • —Target Tokens: ~1000 per chunk
  • —Average Words: 203.7 per chunk
  • —Average Tokens: 264.3 per chunk

Embedding Properties

  • —Normalization: L2 normalized (optimal for cosine similarity)
  • —Value Range: Approximately [-0.12, 0.12]
  • —Distribution: Symmetric around zero
  • —Sparsity: <0.5% (very dense)

Citation

If you use this dataset in your research or application, please cite:

bibtex
@dataset{philippine_budget_2025_embeddings_mpnet,
  title={Philippine Budget 2025 - Vector Embeddings (all-mpnet-base-v2)},
  author={Department of Budget and Management, Philippines},
  year={2025},
  publisher={Hugging Face},
  howpublished={\url{https://huggingface.co/datasets/pageman/philippine-budget-2025-embeddings-mpnet}}
}

License

This dataset is released under the Creative Commons Attribution 4.0 International (CC BY 4.0) license, consistent with the source document's public information and educational use policy.

Related Resources

Contact & Support

  • —Budget Questions: Visit DBM website
  • —Technical Issues: Open an issue on this dataset's discussion page
  • —Dataset Maintainer: @pageman

Acknowledgments

  • —Department of Budget and Management (DBM), Philippines for publishing the source document
  • —Sentence Transformers team for the embedding models
  • —Hugging Face for dataset hosting infrastructure

Dataset Version: 1.0 Last Updated: 2025-10-18 Status: ✅ Production Ready