pageman/philippine-budget-2025-embeddings-minilm
Philippine Budget 2025 - Vector Embeddings (all-MiniLM-L6-v2) Dataset Description This dataset contains vector embeddings of the 2025 People's Budget of the Philippines, a citizen-friendly overview of the PHP 6.326 trillion national budget published by the Department of Budget and Management (DBM). Source Document These embeddings are based on the 2025 People's Enacted Budget (English version, revised as of April 22, 2025). Direct Download Link:… See the full description on the dataset page: https://huggingface.co/datasets/pageman/philippine-budget-2025-embeddings-minilm.
Philippine Budget 2025 - Vector Embeddings (all-MiniLM-L6-v2)
Dataset Description
This dataset contains vector embeddings of the 2025 People's Budget of the Philippines, a citizen-friendly overview of the PHP 6.326 trillion national budget published by the Department of Budget and Management (DBM).
Source Document
These embeddings are based on the 2025 People's Enacted Budget (English version, revised as of April 22, 2025).
Direct Download Link: 2025 People's Enacted Budget PDF
This 100+ page PDF provides a citizen-friendly overview of the PHP 6.326 trillion national budget, including:
- Sector breakdowns
- Priorities like Education (PHP 977.6B)
- Infrastructure (PHP 1.507T)
- Health, Social Protection, Food Security, and more
A Filipino version is also available via the DBM website.
Model Information
- Embedding Model:
all-MiniLM-L6-v2 - Embedding Dimensions: 384
- Description: Fast and efficient (384 dimensions)
- Total Embeddings: 55
- Library: sentence-transformers
- Generated: 2025-10-18T11:40:47.888963
Quality Metrics
- Normalization: L2 normalized (all vectors have norm = 1.0)
- Sparsity: 0.78% (very dense embeddings)
- Dimension Efficiency: 90.10%
- Processing Speed: 1.46 seconds for 55 chunks
Dataset Structure
Data Fields
Data Splits
This dataset contains a single split (train) with 55 examples.
Document Coverage
The embeddings cover all major sections of the Philippine Budget 2025:
- ✅ Budget Dimensions: By sector (traditional and COFOG), expense class, recipient unit, region, special purpose fund, appropriation source
- ✅ Spending Priorities: Education, Health, Social Protection, Food Security, Industry/Workforce/Tourism, Science & Technology, Infrastructure, Peace & Order, Governance, Environment
- ✅ Financing: The 2025 Budget and the Economy, Fiscal Program, Revenues, Borrowings
- ✅ Budget Basics: Budget Cycle, Glossary, Ask Your Government, Off-Budget Accounts
Usage
Load the Dataset
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-minilm")
# Access embeddings
embeddings = dataset['train']['embedding']
texts = dataset['train']['text']
pages = dataset['train']['page']
print(f"Loaded {len(embeddings)} embeddings with {len(embeddings[0])} dimensions")Semantic Search Example
from datasets import load_dataset
from sentence_transformers import SentenceTransformer
import numpy as np
from sklearn.metrics.pairwise import cosine_similarity
# Load dataset and model
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-minilm")
model = SentenceTransformer('all-MiniLM-L6-v2')
# Get embeddings
doc_embeddings = np.array(dataset['train']['embedding'])
texts = dataset['train']['text']
# Search
query = "What is the education budget allocation?"
query_embedding = model.encode(query)
similarities = cosine_similarity([query_embedding], doc_embeddings)[0]
# Get top 5 results
top_indices = np.argsort(similarities)[-5:][::-1]
for idx in top_indices:
print(f"Score: {similarities[idx]:.4f}")
print(f"Page: {dataset['train']['page'][idx]}")
print(f"Text: {texts[idx][:200]}...")
print()Use with ChromaDB
import chromadb
from datasets import load_dataset
# Load dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-minilm")
# Initialize ChromaDB
client = chromadb.Client()
collection = client.create_collection("philippine_budget")
# Add to collection
collection.add(
ids=[item['chunk_id'] for item in dataset['train']],
embeddings=[item['embedding'] for item in dataset['train']],
documents=[item['text'] for item in dataset['train']],
metadatas=[{'page': item['page'], 'section': item['section']} for item in dataset['train']]
)
# Query
results = collection.query(
query_texts=["infrastructure spending priorities"],
n_results=5
)
print(results)Use with LangChain (RAG)
from langchain.vectorstores import Chroma
from langchain.embeddings import HuggingFaceEmbeddings
from datasets import load_dataset
# Load dataset
dataset = load_dataset("pageman/philippine-budget-2025-embeddings-minilm")
# Create embeddings
embeddings = HuggingFaceEmbeddings(model_name='all-MiniLM-L6-v2')
# Create vector store
texts = dataset['train']['text']
metadatas = [{'page': p, 'section': s} for p, s in zip(
dataset['train']['page'],
dataset['train']['section']
)]
vectorstore = Chroma.from_texts(
texts=texts,
embedding=embeddings,
metadatas=metadatas
)
# Use as retriever
retriever = vectorstore.as_retriever(search_kwargs={"k": 5})
docs = retriever.get_relevant_documents("healthcare funding")Model Comparison
When to Use This Model
Use all-MiniLM-L6-v2 when:
- ✅ You need fast semantic search (12x faster than MPNet)
- ✅ You're building real-time applications
- ✅ You have storage constraints
- ✅ You're deploying to mobile/edge devices
- ✅ You need to scale to millions of documents
Use Cases
1. Semantic Search Portal
Build a citizen-friendly search interface for budget information:
query = "How much is allocated for public schools?"
# Returns relevant budget sections with similarity scores2. Budget Q&A Chatbot (RAG)
Create an AI assistant that answers budget questions using retrieval-augmented generation.
3. Policy Analysis Tool
Enable researchers to quickly find and analyze budget allocations across sectors and regions.
4. Budget Comparison System
Compare spending priorities across different fiscal years or government departments.
5. Transparency Dashboard
Build interactive visualizations with semantic filtering and exploration.
Source Document Details
- Title: AGENDA FOR PROSPERITY: Fulfilling the Needs and Aspirations of the Filipino People
- Publisher: Department of Budget and Management (DBM), Philippines
- Fiscal Year: 2025
- Total Budget: PHP 6.326 trillion (22.1% of GDP)
- Document Type: People's Enacted Budget (Citizen-friendly version)
- Pages: 55
- Last Revised: April 22, 2025
- Languages Available: English, Filipino
Key Budget Highlights
- Education: PHP 977.6 billion (highest allocation)
- Infrastructure: PHP 1.507 trillion
- Health: Substantial allocations for universal healthcare
- Social Protection: Programs for vulnerable sectors
- Food Security: Agricultural and agribusiness support
Technical Specifications
Chunking Strategy
- Method: Semantic units with 20% overlap
- Target Tokens: ~1000 per chunk
- Average Words: 203.7 per chunk
- Average Tokens: 264.3 per chunk
Embedding Properties
- Normalization: L2 normalized (optimal for cosine similarity)
- Value Range: Approximately [-0.12, 0.12]
- Distribution: Symmetric around zero
- Sparsity: <1% (very dense)
Citation
If you use this dataset in your research or application, please cite:
@dataset{philippine_budget_2025_embeddings_minilm,
title={Philippine Budget 2025 - Vector Embeddings (all-MiniLM-L6-v2)},
author={Department of Budget and Management, Philippines},
year={2025},
publisher={Hugging Face},
howpublished={\url{https://huggingface.co/datasets/pageman/philippine-budget-2025-embeddings-minilm}}
}License
This dataset is released under the Creative Commons Attribution 4.0 International (CC BY 4.0) license, consistent with the source document's public information and educational use policy.
Related Resources
- Source PDF: 2025 People's Enacted Budget
- DBM Website: https://www.dbm.gov.ph/
- Model Card: all-MiniLM-L6-v2
- Library: Sentence Transformers
- Alternative Model: all-mpnet-base-v2
Contact & Support
- Budget Questions: Visit DBM website
- Technical Issues: Open an issue on this dataset's discussion page
- Dataset Maintainer: @pageman
Acknowledgments
- Department of Budget and Management (DBM), Philippines for publishing the source document
- Sentence Transformers team for the embedding models
- Hugging Face for dataset hosting infrastructure
Dataset Version: 1.0 Last Updated: 2025-10-18 Status: ✅ Production Ready
