CoolFace
Datasetpublic

G-reen/cc-2021-stat

Auto-Generated FastDetector Dataset Dataset: G-reen/cc-2021-stat Globals Config: config/globals.toml Analysis Config: config/analysis_nofilter.toml Rows: 23,214 Evaluation Results Prompt Subsets: 4 (direct_reference, indirect_reference, revise, rewrite) Generator Configs: 7 (Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6), Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25), Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6), Qwen3-8B-AWQ (Temp: 0.7)… See the full description on the dataset page: https://huggingface.co/datasets/G-reen/cc-2021-stat.

sourceHugging Faceupdated 14d agoView on Hugging Face
0likes531downloads
Dataset Card

Auto-Generated FastDetector Dataset

  • Dataset: G-reen/cc-2021-stat
  • Globals Config: config/globals.toml
  • Analysis Config: config/analysis_nofilter.toml
  • Rows: 23,214

Evaluation Results

  • Prompt Subsets: 4 (directreference, indirectreference, revise, rewrite)
  • Generator Configs: 7 (Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6), Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25), Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6), Qwen3-8B-AWQ (Temp: 0.7), gemma-4-E4B-it (Temp: 0.7), granite-4.1-8b-AWQ-INT4 (Temp: 0.6), granite-4.1-8b-AWQ-INT4 (Temp: 1.25))
  • Classifiers: 13 (EditLens Roberta-Large Score, EditLens Roberta-Large Bucket, Perplexity (Llama-3.2-3B-Instruct), Perplexity (Llama-3.2-3B), Entropy (Llama-3.2-3B-Instruct), Entropy (Llama-3.2-3B), Top-p Outliers (Llama-3.2-3B-Instruct), Top-p Outliers (Llama-3.2-3B), Top-k Outliers (Llama-3.2-3B-Instruct), Top-k Outliers (Llama-3.2-3B), FastDetectGPT (Llama-3.2-3B-Instruct), FastDetectGPT (Llama-3.2-3B), Binoculars)
  • Filter Conditions: None
  • Evaluation / Validation Rows: 20,892 / 2,322 (validation_size = 0.1)
  • Base Columns: original (Human), final_response (AI)

The best classifier was EditLens Roberta-Large Score with an AUROC of 0.8775. The hardest prompt subset was rewrite with a TPR of 0.0536, and the hardest generator config was gemma-4-E4B-it (Temp: 0.7) with a TPR of 0.0693.

ClassifierThresholdAUROCTPRFPRAccuracyF1
✔️ EditLens Roberta-Large Score0.59610.87750.35880.00460.67710.5263
EditLens Roberta-Large Bucket0.00000.81450.66560.05130.80720.7754
Binoculars1.04720.63020.01210.00310.50450.0239
FastDetectGPT (Llama-3.2-3B-Instruct)6.77700.57250.00270.00410.49930.0054
Top-k Outliers (Llama-3.2-3B-Instruct)0.01090.56370.01910.00330.50790.0373
Top-p Outliers (Llama-3.2-3B-Instruct)0.01580.55980.01080.00300.50390.0213
Perplexity (Llama-3.2-3B-Instruct)2.26980.54780.00550.00450.50050.0108
Entropy (Llama-3.2-3B-Instruct)0.75750.53910.00320.00440.49940.0063
Top-p Outliers (Llama-3.2-3B)0.00540.51680.00620.00710.49950.0122
Top-k Outliers (Llama-3.2-3B)0.00560.51680.00530.00480.50020.0104
FastDetectGPT (Llama-3.2-3B)-3.23260.51590.09860.00660.54600.1784
Entropy (Llama-3.2-3B)0.28880.48690.00050.00490.49780.0010
❗ Perplexity (Llama-3.2-3B)1.29160.48540.00050.00440.49800.0010

Classifier metrics averaged within each prompt and generator subset:

SubsetAverage AUROCAverage TPRAverage FPRAverage AccuracyAverage F1
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)0.65940.07000.00740.53130.1065
Model: Qwen3-8B-AWQ (Temp: 0.7)0.62850.07040.00770.53130.1015
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)0.62280.12640.00860.55890.1383
Prompt: revise0.61840.11200.00820.55190.1353
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)0.61150.09400.00860.54270.1174
Prompt: indirect_reference0.60090.10860.00760.55050.1445
Prompt: direct_reference0.59610.09210.00860.54170.1263
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)0.57260.10510.00830.54840.1302
Model: gemma-4-E4B-it (Temp: 0.7)0.54720.06930.00690.53120.0935
Prompt: rewrite0.53140.05360.00810.52270.0812
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)0.46430.10650.00970.54840.1412

✔️ marks the best AUROC, ❗ the worst.

Statistics of Interest

[image] [image] [image] [image]

Appendix

Table of contents 1. Univariate Analysis 2. Correlation Heatmap 3. Distance Histograms 4. Distance Histograms per Prompt Subset 5. Distance Histograms per Generator Config Subset 6. Classifier: EditLens Roberta-Large Score - Performance: - Thresholding: - Classification Histograms: 7. Classifier: EditLens Roberta-Large Bucket - Performance: - Thresholding: - Classification Histograms: 8. Classifier: Perplexity (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 9. Classifier: Perplexity (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 10. Classifier: Entropy (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 11. Classifier: Entropy (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 12. Classifier: Top-p Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 13. Classifier: Top-p Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 14. Classifier: Top-k Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 15. Classifier: Top-k Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 16. Classifier: FastDetectGPT (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 17. Classifier: FastDetectGPT (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 18. Classifier: Binoculars - Performance: - Thresholding: - Classification Histograms:

Univariate Analysis

Every statistic the report does arithmetic on, over the 20,892-row evaluation split. Invalid counts rows whose value is missing or non-finite; those rows are excluded from the other columns.

StatisticNMeanMedianStdMinMaxInvalid
jaccard_120,8920.64160.74340.27320.00001.00000
jaccard_220,8920.75820.90060.29290.00001.00000
levenshtein20,8922308.94641404.00003256.25440.000087016.00000
softngram20,8920.59140.67540.34890.00001.00000
cosdist20,8920.20480.13780.1991-0.00761.02110
bertscore20,8920.14550.15130.0808-0.00000.49920
bertscore_precision20,8920.14390.14980.0825-0.00000.45120
bertscore_recall20,8920.14590.14990.0842-0.00000.58740
moverscore20,8920.55160.59750.20480.01061.13480
reranker20,892-2.8360-4.68755.6218-11.000018.75000
EditLens Roberta-Large Score (Human)20,8920.05650.02120.09150.00630.99950
EditLens Roberta-Large Score (AI)20,8920.47350.40290.36390.00650.99960
EditLens Roberta-Large Bucket (Human)20,8920.06050.00000.29080.00003.00000
EditLens Roberta-Large Bucket (AI)20,8921.35141.00001.25340.00003.00000
Perplexity (Llama-3.2-3B-Instruct) (Human)20,89218.993014.478831.44861.05542279.93070
Perplexity (Llama-3.2-3B-Instruct) (AI)20,89282.521813.0928437.09041.065510003.40670
Perplexity (Llama-3.2-3B) (Human)20,89213.798411.064819.78311.02821479.08990
Perplexity (Llama-3.2-3B) (AI)20,89289.138711.1958520.15881.063813124.92010
Entropy (Llama-3.2-3B-Instruct) (Human)20,8922.52712.48940.63000.06297.82580
Entropy (Llama-3.2-3B-Instruct) (AI)20,8922.60202.40181.16490.10779.30560
Entropy (Llama-3.2-3B) (Human)20,8922.38252.40050.57070.04116.33060
Entropy (Llama-3.2-3B) (AI)20,8922.55702.40120.96640.09098.37890
Top-p Outliers (Llama-3.2-3B-Instruct) (Human)20,8920.05540.05350.01630.00000.28570
Top-p Outliers (Llama-3.2-3B-Instruct) (AI)20,8920.05220.05070.01730.00000.23080
Top-p Outliers (Llama-3.2-3B) (Human)20,8920.04150.04140.01270.00000.17740
Top-p Outliers (Llama-3.2-3B) (AI)20,8920.04250.04010.01960.00000.22220
Top-k Outliers (Llama-3.2-3B-Instruct) (Human)20,8920.10600.09730.05230.00000.64520
Top-k Outliers (Llama-3.2-3B-Instruct) (AI)20,8920.11690.08650.12380.00000.87960
Top-k Outliers (Llama-3.2-3B) (Human)20,8920.08680.07880.04740.00000.55290
Top-k Outliers (Llama-3.2-3B) (AI)20,8920.10760.07600.12350.00000.88020
FastDetectGPT (Llama-3.2-3B-Instruct) (Human)20,892-1.6739-1.73961.9618-21.823925.21610
FastDetectGPT (Llama-3.2-3B-Instruct) (AI)20,892-1.1973-1.35171.9641-21.061020.26450
FastDetectGPT (Llama-3.2-3B) (Human)20,892-0.1766-0.14491.1141-7.37309.37170
FastDetectGPT (Llama-3.2-3B) (AI)20,892-0.7282-0.25233.8187-38.964416.26030
Binoculars (Human)20,8920.82800.85160.13090.00751.20990
Binoculars (AI)20,8920.87480.87870.08760.02571.17610

Correlation Heatmap

Pearson correlation between every statistic of interest, computed over the rows where both statistics are present.

[image]

Distance Histograms

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Prompt Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.87750.35880.00460.67710.5263
Prompt: direct_reference10,3560.84050.41810.00410.70700.5880
Prompt: indirect_reference10,1820.93330.43310.00550.71380.6021
Prompt: revise10,6660.96620.45680.00390.72640.6254
❗ Prompt: rewrite10,5800.77110.13040.00490.56280.2298
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.81770.26420.00400.63010.4166
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.85370.16660.00700.57980.2838
✔️ Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.99070.64510.00340.82080.7826
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.80770.29580.00720.64430.4541
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.85230.25150.00270.62440.4011
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.90290.43640.00240.71700.6066
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.92490.46420.00540.72940.6317
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.5961.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.81450.66560.05130.80720.7754
Prompt: direct_reference10,3560.78970.61240.05080.78080.7364
Prompt: indirect_reference10,1820.85160.73620.05170.84230.8236
Prompt: revise10,6660.92390.87850.04910.91470.9115
❗ Prompt: rewrite10,5800.69280.43520.05370.69070.5846
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.70880.45710.05080.70320.6063
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.77090.59360.05660.76850.7194
✔️ Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.97430.97030.04950.96040.9608
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.73430.50930.05170.72880.6526
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.78530.61020.04920.78050.7354
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.85270.73720.05240.84240.8239
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.88380.79760.04890.87440.8639
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.54780.00550.00450.50050.0108
Prompt: direct_reference10,3560.57780.00620.00520.50050.0122
Prompt: indirect_reference10,1820.55900.01320.00270.50520.0259
Prompt: revise10,6660.58670.00130.00510.49810.0026
Prompt: rewrite10,5800.46720.00150.00470.49840.0030
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.73930.02540.00300.51120.0494
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.21140.00070.00570.49750.0013
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.60830.00070.00650.49710.0014
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.68660.00460.00330.50070.0091
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.47500.00200.00330.49930.0040
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.61440.00370.00510.49930.0074
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.49900.00070.00440.49810.0014
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 2.2698.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.48540.00050.00440.49800.0010
Prompt: direct_reference10,3560.50680.00040.00580.49730.0008
Prompt: indirect_reference10,1820.48520.00100.00260.49920.0020
Prompt: revise10,6660.51490.00000.00490.49760.0000
Prompt: rewrite10,5800.43380.00060.00430.49810.0011
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.67740.00070.00230.49920.0013
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.15640.00030.00630.49700.0007
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.53260.00000.00550.49730.0000
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.64810.00070.00290.49890.0013
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.40610.00070.00230.49920.0013
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.55120.00070.00540.49760.0014
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.42660.00030.00610.49710.0007
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.2916.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.53910.00320.00440.49940.0063
Prompt: direct_reference10,3560.56680.00290.00500.49890.0057
Prompt: indirect_reference10,1820.54090.00770.00260.50260.0152
Prompt: revise10,6660.57990.00090.00470.49810.0019
Prompt: rewrite10,5800.46780.00130.00510.49810.0026
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.70330.01190.00260.50460.0234
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.24670.00030.00530.49750.0007
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.57430.00070.00580.49740.0014
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.66520.00390.00330.50030.0078
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.46080.00170.00330.49920.0033
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.60650.00240.00510.49860.0047
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.51670.00100.00510.49800.0020
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.7575.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.48690.00050.00490.49780.0010
Prompt: direct_reference10,3560.47550.00040.00620.49710.0008
Prompt: indirect_reference10,1820.47830.00100.00370.49860.0020
Prompt: revise10,6660.53430.00000.00540.49730.0000
Prompt: rewrite10,5800.45670.00080.00420.49830.0015
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.63790.00030.00300.49870.0007
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.21510.00030.00570.49730.0007
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.49740.00000.00610.49690.0000
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.61060.00130.00420.49850.0026
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.41350.00030.00270.49880.0007
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.55250.00100.00680.49710.0020
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.48140.00030.00580.49730.0007
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.2888.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.55980.01080.00300.50390.0213
Prompt: direct_reference10,3560.58370.01600.00290.50660.0315
Prompt: indirect_reference10,1820.59770.02460.00290.51080.0478
Prompt: revise10,6660.53200.00170.00360.49910.0034
Prompt: rewrite10,5800.52800.00170.00260.49950.0034
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.69630.05010.00300.52360.0952
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.57040.00430.00400.50020.0086
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.55630.00100.00270.49910.0020
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.61470.01110.00260.50420.0219
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.51180.00440.00200.50120.0087
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.52980.00270.00240.50020.0054
❗ Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.43250.00100.00440.49830.0020
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0158.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.51680.00620.00710.49950.0122
Prompt: direct_reference10,3560.61070.01000.00770.50120.0197
Prompt: indirect_reference10,1820.52490.01280.00630.50320.0251
Prompt: revise10,6660.49530.00090.00750.49670.0019
Prompt: rewrite10,5800.43960.00130.00680.49730.0026
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.67520.01680.00530.50580.0329
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.21960.00100.00830.49630.0020
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.60090.00030.00750.49640.0007
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.66620.01440.00720.50360.0282
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.48510.00400.00400.50000.0080
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.55880.00340.00850.49740.0067
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.41000.00270.00880.49690.0054
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0054.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.56370.01910.00330.50790.0373
Prompt: direct_reference10,3560.61610.03730.00410.51660.0716
Prompt: indirect_reference10,1820.56620.03460.00180.51640.0667
Prompt: revise10,6660.59980.00380.00340.50020.0074
Prompt: rewrite10,5800.47250.00170.00380.49900.0034
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.71960.06270.00200.53030.1177
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.25950.00130.00530.49800.0026
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.64210.00100.00480.49810.0020
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.69110.04870.00230.52320.0927
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.50500.00130.00130.50000.0027
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.60510.01230.00440.50390.0241
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.52260.00410.00270.50070.0081
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0109.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.51680.00530.00480.50020.0104
Prompt: direct_reference10,3560.56220.00850.00540.50150.0168
Prompt: indirect_reference10,1820.51130.01040.00390.50320.0205
Prompt: revise10,6660.54650.00110.00540.49780.0022
Prompt: rewrite10,5800.44650.00130.00430.49850.0026
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.67780.01550.00330.50610.0304
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.20990.00070.00600.49730.0013
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.58630.00000.00550.49730.0000
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.66590.01470.00390.50540.0289
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.45140.00070.00270.49900.0013
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.55700.00410.00710.49850.0081
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.46830.00070.00510.49780.0014
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0056.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.57250.00270.00410.49930.0054
Prompt: direct_reference10,3560.59000.00230.00480.49870.0046
Prompt: indirect_reference10,1820.62990.00200.00450.49870.0039
Prompt: revise10,6660.54020.00340.00470.49930.0067
Prompt: rewrite10,5800.53340.00320.00250.50040.0064
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.69450.00130.00530.49800.0026
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.54190.00800.00670.50070.0158
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.59230.00070.00270.49900.0014
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.58910.00100.00160.49970.0020
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.56900.00440.00570.49930.0086
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.54430.00170.00440.49860.0034
❗ Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.47150.00200.00240.49980.0041
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 6.7770.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.51590.09860.00660.54600.1784
Prompt: direct_reference10,3560.42880.07090.00700.53200.1315
Prompt: indirect_reference10,1820.48310.11590.00750.55420.2063
Prompt: revise10,6660.55410.10010.00560.54730.1811
Prompt: rewrite10,5800.59440.10760.00620.55070.1931
❗ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.29390.00300.00820.49740.0059
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.89920.56730.00570.78080.7213
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.39790.01430.00750.50340.0281
Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.30760.00820.00620.50100.0161
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.55190.01310.00640.50330.0256
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.46750.00990.00540.50220.0194
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.69240.07230.00650.53290.1341
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of -3.2326.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]

Classifier: Binoculars

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall41,7840.63020.01210.00310.50450.0239
Prompt: direct_reference10,3560.60060.01140.00270.50430.0225
Prompt: indirect_reference10,1820.65000.01920.00370.50780.0376
Prompt: revise10,6660.66540.00750.00340.50210.0148
Prompt: rewrite10,5800.60460.01060.00260.50400.0209
Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 0.6)6,0640.53110.00130.00360.49880.0026
✔️ Model: Meta-Llama-3.1-8B-Instruct-AWQ-INT4 (Temp: 1.25)6,0040.88160.04030.00330.51850.0772
Model: Ministral-3-8B-Instruct-2512-AWQ-4bit (Temp: 0.6)5,8600.54290.00920.00380.50270.0182
❗ Model: Qwen3-8B-AWQ (Temp: 0.7)6,1180.48380.00130.00360.49890.0026
Model: gemma-4-E4B-it (Temp: 0.7)5,9720.64670.00740.00330.50200.0146
Model: granite-4.1-8b-AWQ-INT4 (Temp: 0.6)5,8760.60740.00650.00170.50240.0128
Model: granite-4.1-8b-AWQ-INT4 (Temp: 1.25)5,8900.71400.01900.00240.50830.0372
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.0472.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image]