CoolFace
Datasetpublic

G-reen/cc-re-2021-stat-val

Auto-Generated FastDetector Dataset Dataset: G-reen/cc-re-2021-stat-val Globals Config: config/globals_re2021.toml Analysis Config: config/analysis_nofilter.toml Rows: 9,822 Evaluation Results Prompt Subsets: 4 (direct_reference, indirect_reference, revise, rewrite) Generator Configs: 5 (Hy3-NVFP4-FP8 (Temp: 0.9), Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6), Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7), claude-sonnet-5 (Temp: Unknown), gpt-5.6-luna (Temp:… See the full description on the dataset page: https://huggingface.co/datasets/G-reen/cc-re-2021-stat-val.

sourceHugging Faceupdated 15d agoView on Hugging Face
0likes870downloads
Dataset Card

Auto-Generated FastDetector Dataset

  • Dataset: G-reen/cc-re-2021-stat-val
  • Globals Config: config/globals_re2021.toml
  • Analysis Config: config/analysis_nofilter.toml
  • Rows: 9,822

Evaluation Results

  • Prompt Subsets: 4 (directreference, indirectreference, revise, rewrite)
  • Generator Configs: 5 (Hy3-NVFP4-FP8 (Temp: 0.9), Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6), Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7), claude-sonnet-5 (Temp: Unknown), gpt-5.6-luna (Temp: Unknown))
  • Classifiers: 13 (EditLens Roberta-Large Score, EditLens Roberta-Large Bucket, Perplexity (Llama-3.2-3B-Instruct), Perplexity (Llama-3.2-3B), Entropy (Llama-3.2-3B-Instruct), Entropy (Llama-3.2-3B), Top-p Outliers (Llama-3.2-3B-Instruct), Top-p Outliers (Llama-3.2-3B), Top-k Outliers (Llama-3.2-3B-Instruct), Top-k Outliers (Llama-3.2-3B), FastDetectGPT (Llama-3.2-3B-Instruct), FastDetectGPT (Llama-3.2-3B), Binoculars)
  • Filter Conditions: None
  • Evaluation / Validation Rows: 8,839 / 983 (validation_size = 0.1)
  • Base Columns: original (Human), final_response (AI)

The best classifier was EditLens Roberta-Large Score with an AUROC of 0.8623. The hardest prompt subset was rewrite with a TPR of 0.0384, and the hardest generator config was Hy3-NVFP4-FP8 (Temp: 0.9) with a TPR of 0.0542.

ClassifierThresholdAUROCTPRFPRAccuracyF1
✔️ EditLens Roberta-Large Score0.82610.86230.20730.00230.60250.3427
EditLens Roberta-Large Bucket0.00000.76460.57370.05790.75790.7032
Entropy (Llama-3.2-3B-Instruct)1.47540.63840.08150.00630.53760.1498
Perplexity (Llama-3.2-3B-Instruct)4.80370.63400.07530.00380.53580.1396
Top-k Outliers (Llama-3.2-3B-Instruct)0.01720.61280.04280.00250.52010.0818
Top-p Outliers (Llama-3.2-3B)0.00340.61230.00500.00410.50050.0099
Binoculars1.00870.60850.03030.00910.51060.0583
Perplexity (Llama-3.2-3B)1.23540.59230.00010.00190.49910.0002
Top-k Outliers (Llama-3.2-3B)0.00120.57920.00090.00070.50010.0018
Entropy (Llama-3.2-3B)0.21950.57580.00020.00200.49910.0005
Top-p Outliers (Llama-3.2-3B-Instruct)0.02750.52770.03540.00810.51360.0679
FastDetectGPT (Llama-3.2-3B-Instruct)3.34280.49900.00380.00690.49850.0076
❗ FastDetectGPT (Llama-3.2-3B)-3.18160.39500.00890.00370.50260.0177

Classifier metrics averaged within each prompt and generator subset:

SubsetAverage AUROCAverage TPRAverage FPRAverage AccuracyAverage F1
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)0.67060.13360.00940.56210.1817
Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)0.66060.10470.00780.54840.1625
Prompt: indirect_reference0.63700.09160.00850.54160.1402
Prompt: direct_reference0.63350.11050.00780.55130.1595
Prompt: revise0.62570.08220.00870.53670.1066
Model: gpt-5.6-luna (Temp: Unknown)0.61230.05780.00910.52440.0815
Model: claude-sonnet-5 (Temp: Unknown)0.59510.05980.00750.52610.0848
Prompt: rewrite0.52830.03840.00870.51480.0621
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)0.50270.05420.00840.52290.0800

✔️ marks the best AUROC, ❗ the worst.

Statistics of Interest

[image] [image] [image] [image]

Appendix

Table of contents 1. Univariate Analysis 2. Correlation Heatmap 3. Distance Histograms 4. Distance Histograms per Prompt Subset 5. Distance Histograms per Generator Config Subset 6. Classifier: EditLens Roberta-Large Score - Performance: - Thresholding: - Classification Histograms: 7. Classifier: EditLens Roberta-Large Bucket - Performance: - Thresholding: - Classification Histograms: 8. Classifier: Perplexity (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 9. Classifier: Perplexity (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 10. Classifier: Entropy (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 11. Classifier: Entropy (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 12. Classifier: Top-p Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 13. Classifier: Top-p Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 14. Classifier: Top-k Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 15. Classifier: Top-k Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 16. Classifier: FastDetectGPT (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 17. Classifier: FastDetectGPT (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 18. Classifier: Binoculars - Performance: - Thresholding: - Classification Histograms:

Univariate Analysis

Every statistic the report does arithmetic on, over the 8,839-row evaluation split. Invalid counts rows whose value is missing or non-finite; those rows are excluded from the other columns.

StatisticNMeanMedianStdMinMaxInvalid
jaccard_18,8390.60760.71280.27680.00001.00000
jaccard_28,8390.72740.87500.29920.00001.00000
levenshtein8,8392109.13521222.00003177.30811.000063409.00000
softngram8,8390.52870.57140.34620.00001.00000
cosdist8,8390.16920.09900.1874-0.00731.02410
bertscore8,8390.12650.13510.07480.00010.69150
bertscore_precision8,8390.12250.12820.07310.00010.67790
bertscore_recall8,8390.12940.13530.08130.00000.70400
moverscore8,8390.50680.56470.19980.03971.24790
reranker8,839-4.4972-6.68755.3779-11.312517.12500
EditLens Roberta-Large Score (Human)8,8390.05810.02030.09650.00630.99960
EditLens Roberta-Large Score (AI)8,8390.40770.30690.34960.00640.99960
EditLens Roberta-Large Bucket (Human)8,8390.06770.00000.30380.00003.00000
EditLens Roberta-Large Bucket (AI)8,8391.13231.00001.23370.00003.00000
Perplexity (Llama-3.2-3B-Instruct) (Human)8,83918.574515.733212.89031.7117630.41840
Perplexity (Llama-3.2-3B-Instruct) (AI)8,83915.695112.590519.46281.13531026.70110
Perplexity (Llama-3.2-3B) (Human)8,83913.845512.14718.42841.0221346.87810
Perplexity (Llama-3.2-3B) (AI)8,83912.835510.447716.89591.12051166.16890
Entropy (Llama-3.2-3B-Instruct) (Human)8,8392.60232.57300.48080.56587.63100
Entropy (Llama-3.2-3B-Instruct) (AI)8,8392.33472.33960.60750.13475.97430
Entropy (Llama-3.2-3B) (Human)8,8392.49222.49420.45340.04145.65250
Entropy (Llama-3.2-3B) (AI)8,8392.37942.38400.49980.12455.08780
Top-p Outliers (Llama-3.2-3B-Instruct) (Human)8,8390.05740.05450.01620.00790.16670
Top-p Outliers (Llama-3.2-3B-Instruct) (AI)8,8390.05590.05360.01860.00000.27780
Top-p Outliers (Llama-3.2-3B) (Human)8,8390.04270.04240.01230.00000.12820
Top-p Outliers (Llama-3.2-3B) (AI)8,8390.03830.03750.01560.00000.20000
Top-k Outliers (Llama-3.2-3B-Instruct) (Human)8,8390.10500.09900.04330.00370.48960
Top-k Outliers (Llama-3.2-3B-Instruct) (AI)8,8390.08960.08270.05210.00000.64290
Top-k Outliers (Llama-3.2-3B) (Human)8,8390.08570.08030.03880.00000.40620
Top-k Outliers (Llama-3.2-3B) (AI)8,8390.07760.06960.04700.00000.57140
FastDetectGPT (Llama-3.2-3B-Instruct) (Human)8,839-1.6820-1.66861.6920-14.088510.51810
FastDetectGPT (Llama-3.2-3B-Instruct) (AI)8,839-1.7002-1.67661.7277-11.75489.81340
FastDetectGPT (Llama-3.2-3B) (Human)8,839-0.1307-0.09571.0472-7.17576.85420
FastDetectGPT (Llama-3.2-3B) (AI)8,8390.37640.33621.5206-11.25008.05660
Binoculars (Human)8,8390.85060.86080.10440.00781.11490
Binoculars (AI)8,8390.88050.88080.07670.06721.32120

Correlation Heatmap

Pearson correlation between every statistic of interest, computed over the rows where both statistics are present.

[image]

Distance Histograms

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Prompt Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.86230.20730.00230.60250.3427
Prompt: direct_reference4,7440.90450.32970.00130.66420.4954
Prompt: indirect_reference4,3840.87600.22490.00270.61110.3664
Prompt: revise4,4440.93790.18090.00320.58890.3056
❗ Prompt: rewrite4,1060.72090.07550.00190.53680.1401
Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.82260.11780.00340.55720.2102
Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.82140.22820.00060.61380.3715
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.95890.39970.00230.69870.5702
Model: claude-sonnet-5 (Temp: Unknown)3,5660.84900.16040.00170.57940.2761
Model: gpt-5.6-luna (Temp: Unknown)3,4820.86170.13150.00340.56400.2318
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.8261.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.76460.57370.05790.75790.7032
Prompt: direct_reference4,7440.81090.65850.05730.80060.7676
Prompt: indirect_reference4,3840.74560.53240.05380.73930.6713
Prompt: revise4,4440.85820.76280.05940.85170.8372
❗ Prompt: rewrite4,1060.62970.31510.06140.62690.4579
Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.71660.48040.05500.71270.6257
Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.72580.49240.05400.71920.6369
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.88820.81360.06730.87310.8651
Model: claude-sonnet-5 (Temp: Unknown)3,5660.74780.54070.05550.74260.6774
Model: gpt-5.6-luna (Temp: Unknown)3,4820.74750.54450.05800.74330.6796
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.63400.07530.00380.53580.1396
Prompt: direct_reference4,7440.67560.12900.00460.56220.2276
Prompt: indirect_reference4,3840.69760.12860.00270.56300.2274
Prompt: revise4,4440.65450.02660.00450.51100.0515
Prompt: rewrite4,1060.49620.00930.00340.50290.0183
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.40250.00450.00340.50060.0089
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.74370.20070.00340.59870.3333
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.73160.14940.00570.57180.2586
Model: claude-sonnet-5 (Temp: Unknown)3,5660.63050.01070.00340.50360.0210
Model: gpt-5.6-luna (Temp: Unknown)3,4820.66520.01150.00340.50400.0226
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 4.8037.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.59230.00010.00190.49910.0002
Prompt: direct_reference4,7440.62150.00000.00040.49980.0000
Prompt: indirect_reference4,3840.66320.00000.00230.49890.0000
Prompt: revise4,4440.60780.00000.00230.49890.0000
Prompt: rewrite4,1060.46710.00050.00290.49880.0010
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.37230.00000.00170.49920.0000
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.70020.00000.00280.49860.0000
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.67100.00000.00230.49890.0000
Model: claude-sonnet-5 (Temp: Unknown)3,5660.58570.00000.00060.49970.0000
Model: gpt-5.6-luna (Temp: Unknown)3,4820.63710.00060.00230.49910.0011
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.2354.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.63840.08150.00630.53760.1498
Prompt: direct_reference4,7440.68050.13360.00800.56280.2341
Prompt: indirect_reference4,3840.69610.14010.00460.56770.2447
Prompt: revise4,4440.65830.03200.00590.51310.0616
Prompt: rewrite4,1060.50810.01220.00680.50270.0239
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.42340.00560.00560.50000.0111
Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.71710.18040.00670.58680.3040
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.74160.18190.00860.58670.3056
Model: claude-sonnet-5 (Temp: Unknown)3,5660.63250.02240.00500.50870.0437
Model: gpt-5.6-luna (Temp: Unknown)3,4820.68040.01720.00570.50570.0337
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.4754.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.57580.00020.00200.49910.0005
Prompt: direct_reference4,7440.58430.00000.00080.49960.0000
Prompt: indirect_reference4,3840.63670.00000.00270.49860.0000
Prompt: revise4,4440.59600.00000.00180.49910.0000
Prompt: rewrite4,1060.48050.00100.00290.49900.0019
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.38240.00000.00110.49940.0000
Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.66290.00060.00280.49890.0011
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.67680.00000.00290.49860.0000
Model: claude-sonnet-5 (Temp: Unknown)3,5660.56540.00000.00110.49940.0000
Model: gpt-5.6-luna (Temp: Unknown)3,4820.59610.00060.00230.49910.0011
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.2195.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.52770.03540.00810.51360.0679
Prompt: direct_reference4,7440.54710.06030.00720.52660.1130
Prompt: indirect_reference4,3840.55370.05110.00780.52170.0965
Prompt: revise4,4440.51690.01310.00900.50200.0255
Prompt: rewrite4,1060.48860.01410.00880.50270.0276
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.47060.01290.01010.50140.0252
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.66090.11130.00840.55140.1988
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.54110.03590.00570.51510.0690
Model: claude-sonnet-5 (Temp: Unknown)3,5660.47980.00900.00730.50080.0177
Model: gpt-5.6-luna (Temp: Unknown)3,4820.48650.00750.00920.49910.0147
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0275.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.61230.00500.00410.50050.0099
Prompt: direct_reference4,7440.67840.00760.00300.50230.0150
Prompt: indirect_reference4,3840.66710.00500.00500.50000.0099
Prompt: revise4,4440.59910.00320.00500.49910.0062
Prompt: rewrite4,1060.49070.00390.00340.50020.0077
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.45810.00340.00220.50060.0067
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.69490.00560.00450.50060.0111
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.62770.01080.00510.50290.0213
Model: claude-sonnet-5 (Temp: Unknown)3,5660.61070.00220.00280.49970.0045
Model: gpt-5.6-luna (Temp: Unknown)3,4820.67350.00290.00570.49860.0057
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0034.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.61280.04280.00250.52010.0818
Prompt: direct_reference4,7440.66040.07880.00250.53820.1458
Prompt: indirect_reference4,3840.67620.07440.00140.53650.1383
Prompt: revise4,4440.62070.00950.00360.50290.0187
Prompt: rewrite4,1060.48350.00340.00240.50050.0068
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.39890.00110.00170.49970.0022
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.72010.12030.00340.55850.2141
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.68340.07870.00290.53790.1455
Model: claude-sonnet-5 (Temp: Unknown)3,5660.61540.00620.00220.50200.0122
Model: gpt-5.6-luna (Temp: Unknown)3,4820.64880.00750.00230.50260.0148
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0172.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.57920.00090.00070.50010.0018
Prompt: direct_reference4,7440.61900.00210.00040.50080.0042
Prompt: indirect_reference4,3840.64650.00140.00090.50020.0027
Prompt: revise4,4440.58140.00000.00090.49950.0000
Prompt: rewrite4,1060.45990.00000.00050.49980.0000
❗ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.37500.00000.00060.49970.0000
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.68420.00170.00000.50080.0034
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.62600.00230.00170.50030.0045
Model: claude-sonnet-5 (Temp: Unknown)3,5660.58300.00000.00000.50000.0000
Model: gpt-5.6-luna (Temp: Unknown)3,4820.63120.00060.00110.49970.0011
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0012.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.49900.00380.00690.49850.0076
Prompt: direct_reference4,7440.50830.00300.00720.49790.0058
Prompt: indirect_reference4,3840.49960.00320.01000.49660.0063
Prompt: revise4,4440.47860.00410.00540.49930.0080
Prompt: rewrite4,1060.50960.00540.00490.50020.0106
Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.50260.00900.01010.49940.0176
✔️ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.63940.00510.00450.50030.0100
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.48850.00060.00680.49690.0011
Model: claude-sonnet-5 (Temp: Unknown)3,5660.44980.00170.00620.49780.0033
❗ Model: gpt-5.6-luna (Temp: Unknown)3,4820.41210.00290.00690.49800.0057
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 3.3428.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.39500.00890.00370.50260.0177
Prompt: direct_reference4,7440.31860.00670.00210.50230.0134
Prompt: indirect_reference4,3840.32350.00680.00550.50070.0135
Prompt: revise4,4440.41040.00950.00360.50290.0187
Prompt: rewrite4,1060.54070.01320.00390.50460.0259
✔️ Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.57260.02020.00340.50840.0395
❗ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.27000.00390.00280.50060.0078
Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.43190.01080.00400.50340.0213
Model: claude-sonnet-5 (Temp: Unknown)3,5660.38220.00620.00340.50140.0122
Model: gpt-5.6-luna (Temp: Unknown)3,4820.31750.00340.00520.49910.0068
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of -3.1816.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]

Classifier: Binoculars

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall17,6780.60850.03030.00910.51060.0583
Prompt: direct_reference4,7440.62700.02660.00670.50990.0514
Prompt: indirect_reference4,3840.59910.02330.01050.50640.0450
Prompt: revise4,4440.61360.02750.00900.50920.0530
Prompt: rewrite4,1060.59220.04530.01020.51750.0858
Model: Hy3-NVFP4-FP8 (Temp: 0.9)3,5640.63750.04940.01070.51940.0932
❗ Model: Llama-4-Scout-17B-16E-Instruct-NVFP4 (Temp: 0.6)3,5580.54760.01070.00790.50140.0210
✔️ Model: Mixtral-8x7B-Instruct-v0.1 (Temp: 0.7)3,5080.65050.05300.00680.52310.1001
Model: claude-sonnet-5 (Temp: Unknown)3,5660.60490.01740.00790.50480.0339
Model: gpt-5.6-luna (Temp: Unknown)3,4820.60260.02130.01210.50460.0411
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.0087.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image]