CoolFace
Datasetpublic

goker/comp-serp-data

Comprehensive SERP Data This dataset contains comprehensive search engine ranking data collected from Google and Bing, along with extracted technical and content features for analyzing search engine ranking algorithms. πŸ“Š Dataset Overview Total Records: 14,465 search results Search Engines: Google (5,895 results) and Bing (8,570 results) Keywords: 500 diverse search queries Features: 20 features including technical scores, content analysis, and ranking metadata… See the full description on the dataset page: https://huggingface.co/datasets/goker/comp-serp-data.

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes39downloads
Dataset Card

Comprehensive SERP Data

This dataset contains comprehensive search engine ranking data collected from Google and Bing, along with extracted technical and content features for analyzing search engine ranking algorithms.

πŸ“Š Dataset Overview

  • β€”Total Records: 14,465 search results
  • β€”Search Engines: Google (5,895 results) and Bing (8,570 results)
  • β€”Keywords: 500 diverse search queries
  • β€”Features: 20 features including technical scores, content analysis, and ranking metadata

🎯 Research Purpose

This dataset was created to empirically characterize and compare the ranking environments of large-scale search engines (Google and Bing) through systematic data collection and feature extraction. It enables research on:

  • β€”Search engine ranking algorithm analysis
  • β€”Cross-engine comparison studies
  • β€”Technical SEO feature importance
  • β€”Content relevance analysis
  • β€”Ranking prediction modeling

πŸ“ Dataset Structure

Main Dataset File

  • β€”File: datasets/dataset.csv
  • β€”Format: CSV (Comma-separated values)
  • β€”Encoding: UTF-8
  • β€”Size: ~2MB

Column Descriptions

Search Metadata
ColumnTypeDescription
querystringThe search query used
enginestringSearch engine (google/bing)
positionintegerRanking position (1-20)
urlstringFull URL of the result
hostnamestringDomain name of the result
file_namestringUnique identifier for the page
Content Features
ColumnTypeDescriptionRange
query_in_titleintegerQuery presence in page title (0/1)0-1
exact_query_in_titleintegerExact query match in title (0/1)0-1
query_in_h1integerQuery presence in H1 tag (0/1)0-1
exact_query_in_h1integerExact query match in H1 (0/1)0-1
query_density_bodyfloatQuery frequency in body content0.0-1.0
semantic_similarity_title_queryfloatSemantic similarity between title and query0.0-1.0
semantic_similarity_content_queryfloatSemantic similarity between content and query0.0-1.0
word_countintegerNumber of words in page content0-∞
Technical Features (Lighthouse Scores)
ColumnTypeDescriptionRange
performance_scorefloatPage load performance score0-100
accessibility_scorefloatWeb accessibility compliance score0-100
best-practices_scorefloatSecurity and best practices score0-100
seo_scorefloatSearch engine optimization score0-100
Analysis Features
ColumnTypeDescription
rank_tierstringRanking tier (High: 1-5, Medium: 6-10, Low: 11-20)
clusterintegerK-means cluster assignment (0-5)

πŸ”¬ Data Collection Methodology

1. Keyword Selection

  • β€”Source: raw/keywords/keywords.csv
  • β€”Count: 500 diverse search queries
  • β€”Categories: E-commerce, services, information, local search
  • β€”Selection Criteria: High search volume, diverse intent types

2. Search Engine Data Collection

  • β€”Google: Custom Search API (top 20 results per query)
  • β€”Bing: Bing Search API (top 20 results per query)
  • β€”Collection Period: Systematic collection with rate limiting
  • β€”Error Handling: Retry mechanisms and exception tracking

3. Web Page Processing

  • β€”HTML Extraction: Full page content capture using headless browsers
  • β€”Screenshot Capture: Visual page representation
  • β€”Performance Measurement: Lighthouse scores via PageSpeed Insights API
  • β€”Content Analysis: NLP-based feature extraction

4. Feature Extraction

  • β€”Technical Features: Automated Lighthouse scoring
  • β€”Content Features: Natural language processing and semantic analysis
  • β€”Query Matching: Exact and fuzzy matching algorithms
  • β€”Semantic Similarity: Sentence transformer-based relevance scoring

πŸ“ˆ Dataset Statistics

Distribution by Search Engine

  • β€”Google: 5,895 results (40.7%)
  • β€”Bing: 8,570 results (59.3%)

Distribution by Ranking Tier

  • β€”High Tier (positions 1-5): 3,784 results (26.2%)
  • β€”Medium Tier (positions 6-10): 3,837 results (26.5%)
  • β€”Low Tier (positions 11-20): 6,844 results (47.3%)

Cluster Distribution

  • β€”Cluster 0: 2,314 results (16.0%)
  • β€”Cluster 1: 2,122 results (14.7%)
  • β€”Cluster 2: 1,522 results (10.5%)
  • β€”Cluster 3: 5,142 results (35.6%)
  • β€”Cluster 4: 2,311 results (16.0%)
  • β€”Cluster 5: 1,054 results (7.3%)

πŸ› οΈ Technical Implementation

Data Collection Pipeline

The dataset was created using the SERP Profiler Kit, a comprehensive research framework with the following components:

  1. 1.Data Collection Modules
  2. 2.Google Custom Search API integration
  3. 3.Bing Search API integration
  4. 4.Web scraping with headless browsers
  5. 5.PageSpeed Insights API integration
  1. 1.Feature Extraction
  2. 2.Natural language processing with sentence transformers
  3. 3.Technical SEO analysis using Lighthouse
  4. 4.Content relevance scoring
  5. 5.Query matching algorithms
  1. 1.Data Processing
  2. 2.Quality validation and outlier detection
  3. 3.Feature normalization and standardization
  4. 4.Cluster analysis using K-means
  5. 5.Statistical analysis and validation

Quality Assurance

  • β€”Exception Tracking: Comprehensive error logging
  • β€”Data Validation: Multi-stage quality checks
  • β€”Outlier Detection: Statistical anomaly identification
  • β€”Reproducibility: Deterministic processing with fixed random seeds

πŸ“Š Research Applications

1. Clustering Analysis (RQ1)

  • β€”Identify distinct ranking profiles using K-means clustering
  • β€”Analyze feature patterns across different ranking strategies
  • β€”Validate cluster quality using multiple metrics

2. Feature Importance Analysis (RQ2)

  • β€”Determine which features most strongly predict ranking positions
  • β€”Compare feature importance across ranking tiers
  • β€”Identify engine-specific ranking factors

3. Cross-Engine Comparison (RQ3)

  • β€”Compare ranking characteristics between Google and Bing
  • β€”Analyze feature distribution differences
  • β€”Identify engine-specific ranking patterns

4. Ranking Prediction (RQ4)

  • β€”Build ordinal logistic regression models for ranking prediction
  • β€”Analyze feature coefficients and significance
  • β€”Validate model assumptions and performance

πŸ”§ Usage Examples

Python Usage

python
import pandas as pd

# Load the dataset
df = pd.read_csv('datasets/dataset.csv')

# Basic statistics
print(f"Dataset shape: {df.shape}")
print(f"Engines: {df['engine'].value_counts()}")
print(f"Rank tiers: {df['rank_tier'].value_counts()}")

# Filter by search engine
google_results = df[df['engine'] == 'google']
bing_results = df[df['engine'] == 'bing']

# Analyze technical features
tech_features = ['performance_score', 'accessibility_score', 
                'best-practices_score', 'seo_score']
print(df[tech_features].describe())

# Analyze content features
content_features = ['query_in_title', 'query_in_h1', 
                   'semantic_similarity_title_query', 'word_count']
print(df[content_features].describe())

R Usage

r
# Load the dataset
df <- read.csv('datasets/dataset.csv')

# Basic analysis
summary(df)
table(df$engine)
table(df$rank_tier)

# Technical features analysis
tech_cols <- c('performance_score', 'accessibility_score', 
               'best.practices_score', 'seo_score')
summary(df[tech_cols])

πŸ”— Related Resources

  • β€”Source Code: SERP Profiler Kit Repository
  • β€”Documentation: Complete methodology and implementation details
  • β€”Analysis Results: Statistical analysis and visualization outputs

πŸ“„ License

This dataset is released under the MIT License. Please ensure compliance with search engine terms of service and website robots.txt files when using this data.

🀝 Contributing

For questions, issues, or contributions:

  • β€”Open an issue on the repository
  • β€”Review the documentation for methodology details
  • β€”Check the analysis results for statistical insights

⚠️ Important Notes

  1. 1.API Compliance: This dataset was collected following search engine API terms of service
  2. 2.Ethical Scraping: All web scraping was performed with respect to robots.txt files
  3. 3.Data Freshness: Search results may change over time; this dataset represents a snapshot
  4. 4.Usage Limitations: This dataset is for research purposes only

Note: This dataset enables systematic analysis of search engine ranking algorithms and provides a foundation for understanding how different factors influence search result positioning across major search engines.

goker/comp-serp-data Β· CoolFace