CoolFace
Datasetpublic

G-reen/fastdetector-test-stat-test

Auto-Generated FastDetector Dataset Dataset: G-reen/fastdetector-test-stat-test Globals Config: config/globals_test.toml Analysis Config: config/analysis.toml Rows: 13,622 Evaluation Results Prompt Subsets: 4 (direct_reference, indirect_reference, revise, rewrite) Generator Configs: 10 (claude-opus-4-5-20251101 (Temp: Unknown), claude-opus-5 (Temp: Unknown), gemini-3.1-pro-preview (Temp: Unknown), gemini-3.8-flash (Temp: Unknown), gpt-5.4 (Temp: Unknown)… See the full description on the dataset page: https://huggingface.co/datasets/G-reen/fastdetector-test-stat-test.

sourceHugging Faceupdated 2h agoView on Hugging Face
0likes615downloads
Dataset Card

Auto-Generated FastDetector Dataset

  • Dataset: G-reen/fastdetector-test-stat-test
  • Globals Config: config/globals_test.toml
  • Analysis Config: config/analysis.toml
  • Rows: 13,622

Evaluation Results

  • Prompt Subsets: 4 (directreference, indirectreference, revise, rewrite)
  • Generator Configs: 10 (claude-opus-4-5-20251101 (Temp: Unknown), claude-opus-5 (Temp: Unknown), gemini-3.1-pro-preview (Temp: Unknown), gemini-3.8-flash (Temp: Unknown), gpt-5.4 (Temp: Unknown), gpt-5.6-sol (Temp: Unknown), grok-4.3 (Temp: Unknown), kimi-k3 (Temp: Unknown), minimax-m3 (Temp: Unknown), qwen3.7-max (Temp: Unknown))
  • Classifiers: 19 (EditLens Roberta-Large Score, EditLens Roberta-Large Bucket, EditLens Llama-3.2-3B Score, EditLens Llama-3.2-3B Bucket, EditLens Giga RoBERTa-Large Score, EditLens Giga RoBERTa-Large Bucket, EditLens Giga Llama-3.2-3B Score, EditLens Giga Llama-3.2-3B Bucket, Perplexity (Llama-3.2-3B-Instruct), Perplexity (Llama-3.2-3B), Entropy (Llama-3.2-3B-Instruct), Entropy (Llama-3.2-3B), Top-p Outliers (Llama-3.2-3B-Instruct), Top-p Outliers (Llama-3.2-3B), Top-k Outliers (Llama-3.2-3B-Instruct), Top-k Outliers (Llama-3.2-3B), FastDetectGPT (Llama-3.2-3B-Instruct), FastDetectGPT (Llama-3.2-3B), Binoculars)
  • Filter Conditions: cosdist >= 0.03 OR softngram >= 0.06
  • Evaluation / Validation Rows: 12,259 / 1,363 (validation_size = 0.1)
  • Base Columns: original (Human), final_response (AI)

The best classifier was EditLens Giga Llama-3.2-3B Score with an AUROC of 0.9442. The hardest prompt subset was rewrite with a TPR of 0.0962, and the hardest generator config was claude-opus-5 (Temp: Unknown) with a TPR of 0.1190.

ClassifierThresholdAUROCTPRFPRAccuracyF1
✔️ EditLens Giga Llama-3.2-3B Score0.10140.94420.64130.00330.81900.7799
EditLens Llama-3.2-3B Score0.23890.92140.61630.00570.80530.7599
EditLens Giga RoBERTa-Large Score0.19100.91070.59300.00410.79440.7426
EditLens Roberta-Large Score0.47470.89300.34110.00310.66900.5076
EditLens Llama-3.2-3B Bucket0.00000.81350.62970.00370.81300.7710
EditLens Giga RoBERTa-Large Bucket0.00000.79250.58810.00430.79190.7386
EditLens Roberta-Large Bucket0.00000.78320.59450.03700.77880.7288
EditLens Giga Llama-3.2-3B Bucket0.00000.77700.55440.00040.77700.7131
Binoculars0.96730.62010.04480.00330.52080.0855
Top-p Outliers (Llama-3.2-3B)0.02010.58010.04000.00490.51750.0765
Entropy (Llama-3.2-3B-Instruct)1.46370.53970.01880.00900.50490.0365
Perplexity (Llama-3.2-3B-Instruct)4.72200.52700.01150.00600.50280.0226
Top-k Outliers (Llama-3.2-3B-Instruct)0.02950.51320.02210.00800.50710.0429
Top-p Outliers (Llama-3.2-3B-Instruct)0.03120.50090.01970.00770.50600.0384
Perplexity (Llama-3.2-3B)3.94210.48600.00960.01000.49980.0189
FastDetectGPT (Llama-3.2-3B-Instruct)3.22710.47900.00670.00390.50140.0132
Top-k Outliers (Llama-3.2-3B)0.01830.47880.01090.00730.50180.0215
Entropy (Llama-3.2-3B)1.42280.47200.00930.01140.49890.0182
❗ FastDetectGPT (Llama-3.2-3B)-2.80000.45200.02350.00790.50780.0456

Classifier metrics averaged within each prompt and generator subset:

SubsetAverage AUROCAverage TPRAverage FPRAverage AccuracyAverage F1
✔️ Model: claude-opus-4-5-20251101 (Temp: Unknown)0.69820.29790.00820.64490.3643
Prompt: revise0.69260.32120.00810.65650.3702
Model: minimax-m3 (Temp: Unknown)0.69060.26670.00720.62980.3412
Model: kimi-k3 (Temp: Unknown)0.68010.28080.00730.63670.3540
Prompt: indirect_reference0.66470.22650.00660.61000.3057
Model: gpt-5.6-sol (Temp: Unknown)0.66000.20370.00740.59820.2783
Prompt: direct_reference0.65950.28500.00790.63850.3545
Model: qwen3.7-max (Temp: Unknown)0.65600.30650.00810.64920.3644
Model: gemini-3.8-flash (Temp: Unknown)0.65510.31260.00680.65290.3716
Model: gpt-5.4 (Temp: Unknown)0.64990.18180.00820.58680.2566
Model: gemini-3.1-pro-preview (Temp: Unknown)0.64470.26380.00700.62840.3312
Model: grok-4.3 (Temp: Unknown)0.63950.27630.00690.63470.3443
Model: claude-opus-5 (Temp: Unknown)0.59630.11900.00710.55600.1856
❗ Prompt: rewrite0.57190.09620.00670.54480.1583

✔️ marks the best AUROC, ❗ the worst.

Statistics of Interest

[image] [image] [image] [image]

Appendix

Table of contents 1. Univariate Analysis 2. Correlation Heatmap 3. Distance Histograms 4. Distance Histograms per Prompt Subset 5. Distance Histograms per Generator Config Subset 6. Classifier: EditLens Roberta-Large Score - Performance: - Thresholding: - Classification Histograms: 7. Classifier: EditLens Roberta-Large Bucket - Performance: - Thresholding: - Classification Histograms: 8. Classifier: EditLens Llama-3.2-3B Score - Performance: - Thresholding: - Classification Histograms: 9. Classifier: EditLens Llama-3.2-3B Bucket - Performance: - Thresholding: - Classification Histograms: 10. Classifier: EditLens Giga RoBERTa-Large Score - Performance: - Thresholding: - Classification Histograms: 11. Classifier: EditLens Giga RoBERTa-Large Bucket - Performance: - Thresholding: - Classification Histograms: 12. Classifier: EditLens Giga Llama-3.2-3B Score - Performance: - Thresholding: - Classification Histograms: 13. Classifier: EditLens Giga Llama-3.2-3B Bucket - Performance: - Thresholding: - Classification Histograms: 14. Classifier: Perplexity (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 15. Classifier: Perplexity (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 16. Classifier: Entropy (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 17. Classifier: Entropy (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 18. Classifier: Top-p Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 19. Classifier: Top-p Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 20. Classifier: Top-k Outliers (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 21. Classifier: Top-k Outliers (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 22. Classifier: FastDetectGPT (Llama-3.2-3B-Instruct) - Performance: - Thresholding: - Classification Histograms: 23. Classifier: FastDetectGPT (Llama-3.2-3B) - Performance: - Thresholding: - Classification Histograms: 24. Classifier: Binoculars - Performance: - Thresholding: - Classification Histograms:

Univariate Analysis

Every statistic the report does arithmetic on, over the 12,259-row evaluation split. Invalid counts rows whose value is missing or non-finite; those rows are excluded from the other columns.

StatisticNMeanMedianStdMinMaxInvalid
jaccard_112,2590.64310.72140.23170.00001.00000
jaccard_212,2590.77010.88070.24590.02101.00000
levenshtein12,2592396.60861768.00002580.429135.000079984.00000
softngram12,2590.60530.68330.32360.00001.00000
cosdist12,2590.18190.11040.1830-0.00610.96480
bertscore12,2590.13330.14000.06570.00290.79660
bertscore_precision12,2590.13210.13890.06400.00160.74970
bertscore_recall12,2590.13350.13940.07260.00090.82870
moverscore12,2590.53320.57630.16640.08481.33480
reranker12,259-5.5643-7.06254.2713-10.937517.12500
EditLens Roberta-Large Score (Human)12,2590.04600.02040.07120.00640.98380
EditLens Roberta-Large Score (AI)12,2590.40730.31410.34180.00640.99960
EditLens Roberta-Large Bucket (Human)12,2590.04070.00000.22430.00003.00000
EditLens Roberta-Large Bucket (AI)12,2591.12421.00001.20180.00003.00000
EditLens Llama-3.2-3B Score (Human)12,2590.03000.01590.04050.00030.49050
EditLens Llama-3.2-3B Score (AI)12,2590.38880.34340.30770.00041.00000
EditLens Llama-3.2-3B Bucket (Human)12,2590.00370.00000.06050.00001.00000
EditLens Llama-3.2-3B Bucket (AI)12,2591.06241.00001.08050.00003.00000
EditLens Giga RoBERTa-Large Score (Human)12,2590.00850.00390.02530.00130.67200
EditLens Giga RoBERTa-Large Score (AI)12,2590.43790.34480.40060.00141.00000
EditLens Giga RoBERTa-Large Bucket (Human)12,2590.00550.00000.09410.00003.00000
EditLens Giga RoBERTa-Large Bucket (AI)12,2591.28251.00001.28370.00003.00000
EditLens Giga Llama-3.2-3B Score (Human)12,2590.00500.00270.01140.00050.18350
EditLens Giga Llama-3.2-3B Score (AI)12,2590.37640.26720.36640.00061.00000
EditLens Giga Llama-3.2-3B Bucket (Human)12,2590.00040.00000.02020.00001.00000
EditLens Giga Llama-3.2-3B Bucket (AI)12,2591.08921.00001.20760.00003.00000
Perplexity (Llama-3.2-3B-Instruct) (Human)12,25915.739014.08957.05932.995465.30620
Perplexity (Llama-3.2-3B-Instruct) (AI)12,25915.671613.729311.80221.0071537.90310
Perplexity (Llama-3.2-3B) (Human)12,25911.941210.90534.98941.206847.06320
Perplexity (Llama-3.2-3B) (AI)12,25912.683511.20339.67191.0034612.34030
Entropy (Llama-3.2-3B-Instruct) (Human)12,2592.50792.49400.43411.07314.22970
Entropy (Llama-3.2-3B-Instruct) (AI)12,2592.44762.43690.49370.03657.18780
Entropy (Llama-3.2-3B) (Human)12,2592.38702.38840.38130.22943.79630
Entropy (Llama-3.2-3B) (AI)12,2592.42822.42680.39900.01005.51160
Top-p Outliers (Llama-3.2-3B-Instruct) (Human)12,2590.05520.05390.01200.02150.12310
Top-p Outliers (Llama-3.2-3B-Instruct) (AI)12,2590.05550.05400.01440.00000.20000
Top-p Outliers (Llama-3.2-3B) (Human)12,2590.04220.04180.00940.00640.07960
Top-p Outliers (Llama-3.2-3B) (AI)12,2590.03960.03900.01200.00000.18180
Top-k Outliers (Llama-3.2-3B-Instruct) (Human)12,2590.09670.09220.03480.00640.26300
Top-k Outliers (Llama-3.2-3B-Instruct) (AI)12,2590.09620.09180.04150.00010.50000
Top-k Outliers (Llama-3.2-3B) (Human)12,2590.07840.07430.03080.00390.21920
Top-k Outliers (Llama-3.2-3B) (AI)12,2590.08240.07730.03800.00010.50000
FastDetectGPT (Llama-3.2-3B-Instruct) (Human)12,259-1.8409-1.79871.6619-10.57085.98970
FastDetectGPT (Llama-3.2-3B-Instruct) (AI)12,259-1.9475-1.94681.9309-14.464756.78240
FastDetectGPT (Llama-3.2-3B) (Human)12,259-0.1500-0.10901.0304-5.87952.76650
FastDetectGPT (Llama-3.2-3B) (AI)12,2590.13330.06321.5958-10.485313.90800
Binoculars (Human)12,2590.84680.85450.06960.03791.00630
Binoculars (AI)12,2590.87200.87170.06160.03551.26660

Correlation Heatmap

Pearson correlation between every statistic of interest, computed over the rows where both statistics are present.

[image]

Distance Histograms

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Prompt Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Distance Histograms per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.89300.34110.00310.66900.5076
Prompt: direct_reference7,1900.89260.44230.00330.71950.6119
Prompt: indirect_reference6,4880.89920.30550.00280.65140.4670
✔️ Prompt: revise7,1140.96820.41500.00370.70570.5850
❗ Prompt: rewrite3,7260.74320.06710.00210.53250.1255
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.92120.45510.00400.72560.6238
Model: claude-opus-5 (Temp: Unknown)2,4400.82210.08770.00250.54260.1609
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.89920.36450.00400.68030.5327
Model: gemini-3.8-flash (Temp: Unknown)2,5540.93850.50980.00230.75370.6743
Model: gpt-5.4 (Temp: Unknown)2,4040.85170.18390.00420.58990.3095
Model: gpt-5.6-sol (Temp: Unknown)2,5120.88900.19510.00240.59630.3258
Model: grok-4.3 (Temp: Unknown)2,2680.89020.40650.00350.70150.5766
Model: kimi-k3 (Temp: Unknown)2,3600.91010.36950.00250.68350.5386
Model: minimax-m3 (Temp: Unknown)2,3760.88790.33670.00170.66750.5031
Model: qwen3.7-max (Temp: Unknown)2,5620.91870.49020.00390.74320.6562
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.4747.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Roberta-Large Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.78320.59450.03700.77880.7288
Prompt: direct_reference7,1900.79030.60220.03370.78430.7363
Prompt: indirect_reference6,4880.76820.57030.04280.76370.7071
✔️ Prompt: revise7,1140.88580.79900.03570.88160.8710
❗ Prompt: rewrite3,7260.59870.23130.03540.59800.3653
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.82870.68230.03730.82250.7935
Model: claude-opus-5 (Temp: Unknown)2,4400.62390.28200.03610.62300.4279
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.81340.65850.04120.80860.7748
Model: gemini-3.8-flash (Temp: Unknown)2,5540.87550.77290.03450.86920.8553
Model: gpt-5.4 (Temp: Unknown)2,4040.68230.39770.03740.68010.5542
Model: gpt-5.6-sol (Temp: Unknown)2,5120.73930.50800.03340.73730.6591
Model: grok-4.3 (Temp: Unknown)2,2680.81380.65520.03970.80780.7732
Model: kimi-k3 (Temp: Unknown)2,3600.81630.66020.03640.81190.7782
Model: minimax-m3 (Temp: Unknown)2,3760.78280.59090.03370.77860.7275
Model: qwen3.7-max (Temp: Unknown)2,5620.84900.72370.03980.84190.8207
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Llama-3.2-3B Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.92140.61630.00570.80530.7599
Prompt: direct_reference7,1900.93320.68850.00830.84010.8115
Prompt: indirect_reference6,4880.90890.54650.00430.77110.7048
✔️ Prompt: revise7,1140.97880.80880.00510.90190.8918
❗ Prompt: rewrite3,7260.81420.23080.00430.61330.3738
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.93490.70060.00710.84670.8205
Model: claude-opus-5 (Temp: Unknown)2,4400.83200.31560.00570.65490.4777
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.93120.63950.00550.81700.7775
Model: gemini-3.8-flash (Temp: Unknown)2,5540.95600.74240.00550.86840.8495
Model: gpt-5.4 (Temp: Unknown)2,4040.90240.50420.00500.74960.6681
Model: gpt-5.6-sol (Temp: Unknown)2,5120.93430.56050.00480.77790.7162
Model: grok-4.3 (Temp: Unknown)2,2680.92650.66050.00530.82760.7930
Model: kimi-k3 (Temp: Unknown)2,3600.92880.66360.00590.82880.7949
Model: minimax-m3 (Temp: Unknown)2,3760.91920.63890.00590.81650.7769
Model: qwen3.7-max (Temp: Unknown)2,5620.94640.72760.00620.86070.8393
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.2389.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Llama-3.2-3B Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.81350.62970.00370.81300.7710
Prompt: direct_reference7,1900.84290.68820.00390.84210.8134
Prompt: indirect_reference6,4880.78240.56750.00340.78210.7225
✔️ Prompt: revise7,1140.90820.81980.00450.90760.8988
❗ Prompt: rewrite3,7260.62990.26190.00210.62990.4144
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.85630.71560.00480.85540.8319
Model: claude-opus-5 (Temp: Unknown)2,4400.65090.30490.00330.65080.4662
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.82900.65930.00160.82880.7939
Model: gemini-3.8-flash (Temp: Unknown)2,5540.87880.76040.00390.87820.8620
Model: gpt-5.4 (Temp: Unknown)2,4040.75580.51500.00420.75540.6780
Model: gpt-5.6-sol (Temp: Unknown)2,5120.78690.57720.00400.78660.7301
Model: grok-4.3 (Temp: Unknown)2,2680.83830.67900.00350.83770.8071
Model: kimi-k3 (Temp: Unknown)2,3600.83770.67800.00340.83730.8065
Model: minimax-m3 (Temp: Unknown)2,3760.81910.64060.00340.81860.7793
Model: qwen3.7-max (Temp: Unknown)2,5620.87640.75570.00470.87550.8585
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Giga RoBERTa-Large Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.91070.59300.00410.79440.7426
Prompt: direct_reference7,1900.92630.66700.00420.83140.7983
Prompt: indirect_reference6,4880.89290.51790.00400.75690.6806
✔️ Prompt: revise7,1140.97350.78440.00480.88980.8768
❗ Prompt: rewrite3,7260.78900.21520.00270.60630.3535
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.94510.70690.00480.85110.8260
Model: claude-opus-5 (Temp: Unknown)2,4400.81440.28030.00410.63810.4365
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.92070.64500.00160.82170.7834
Model: gemini-3.8-flash (Temp: Unknown)2,5540.95480.73840.00390.86730.8476
Model: gpt-5.4 (Temp: Unknown)2,4040.86030.42010.00670.70670.5889
Model: gpt-5.6-sol (Temp: Unknown)2,5120.90670.45780.00480.72650.6260
Model: grok-4.3 (Temp: Unknown)2,2680.90810.64640.00350.82140.7835
Model: kimi-k3 (Temp: Unknown)2,3600.93070.66610.00340.83140.7980
Model: minimax-m3 (Temp: Unknown)2,3760.91780.63220.00510.81360.7722
Model: qwen3.7-max (Temp: Unknown)2,5620.94310.72600.00310.86140.8397
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.1910.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Giga RoBERTa-Large Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.79250.58810.00430.79190.7386
Prompt: direct_reference7,1900.82580.65420.00420.82500.7890
Prompt: indirect_reference6,4880.75350.51020.00460.75280.6736
✔️ Prompt: revise7,1140.89180.78660.00480.89090.8782
❗ Prompt: rewrite3,7260.60690.21690.00320.60680.3555
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.85100.70450.00400.85030.8247
Model: claude-opus-5 (Temp: Unknown)2,4400.62850.26150.00490.62830.4129
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.82240.64580.00160.82210.7840
Model: gemini-3.8-flash (Temp: Unknown)2,5540.86630.73450.00390.86530.8450
Model: gpt-5.4 (Temp: Unknown)2,4040.70180.40850.00580.70130.5776
Model: gpt-5.6-sol (Temp: Unknown)2,5120.72140.44670.00480.72090.6155
Model: grok-4.3 (Temp: Unknown)2,2680.82130.64550.00440.82050.7825
Model: kimi-k3 (Temp: Unknown)2,3600.83030.66360.00420.82970.7957
Model: minimax-m3 (Temp: Unknown)2,3760.81290.62960.00590.81190.7699
Model: qwen3.7-max (Temp: Unknown)2,5620.86370.72990.00390.86300.8420
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Giga Llama-3.2-3B Score

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.94420.64130.00330.81900.7799
Prompt: direct_reference7,1900.95120.73740.00360.86690.8471
Prompt: indirect_reference6,4880.93520.56100.00150.77970.7181
✔️ Prompt: revise7,1140.98530.80660.00390.90130.8910
❗ Prompt: rewrite3,7260.86540.28020.00480.63770.4361
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.96610.73870.00400.86740.8478
Model: claude-opus-5 (Temp: Unknown)2,4400.87260.36890.00330.68280.5376
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.95050.65530.00240.82650.7906
Model: gemini-3.8-flash (Temp: Unknown)2,5540.97250.75410.00310.87550.8583
Model: gpt-5.4 (Temp: Unknown)2,4040.91640.49670.00420.74630.6619
Model: gpt-5.6-sol (Temp: Unknown)2,5120.95250.54460.00240.77110.7041
Model: grok-4.3 (Temp: Unknown)2,2680.94230.70190.00350.84920.8232
Model: kimi-k3 (Temp: Unknown)2,3600.95370.69070.00340.84360.8154
Model: minimax-m3 (Temp: Unknown)2,3760.95030.68430.00420.84010.8106
Model: qwen3.7-max (Temp: Unknown)2,5620.96190.77050.00310.88370.8688
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.1014.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: EditLens Giga Llama-3.2-3B Bucket

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.77700.55440.00040.77700.7131
Prompt: direct_reference7,1900.82700.65400.00000.82700.7908
Prompt: indirect_reference6,4880.73310.46640.00030.73300.6360
✔️ Prompt: revise7,1140.86420.72900.00080.86410.8428
❗ Prompt: rewrite3,7260.59070.18200.00050.59070.3078
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.83380.66800.00080.83360.8006
Model: claude-opus-5 (Temp: Unknown)2,4400.63200.26390.00000.63200.4176
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.78920.57840.00000.78920.7329
Model: gemini-3.8-flash (Temp: Unknown)2,5540.84190.68440.00080.84180.8123
Model: gpt-5.4 (Temp: Unknown)2,4040.69230.38520.00080.69220.5558
Model: gpt-5.6-sol (Temp: Unknown)2,5120.70660.41320.00000.70660.5848
Model: grok-4.3 (Temp: Unknown)2,2680.81450.62960.00090.81440.7723
Model: kimi-k3 (Temp: Unknown)2,3600.80340.60680.00000.80340.7553
Model: minimax-m3 (Temp: Unknown)2,3760.80110.60270.00080.80090.7517
Model: qwen3.7-max (Temp: Unknown)2,5620.85170.70340.00000.85170.8258
Thresholding:
  • Direction: higher_is_ai
  • Swept for f1 with a found threshold of 0.0000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.52700.01150.00600.50280.0226
Prompt: direct_reference7,1900.50420.01340.00670.50330.0262
Prompt: indirect_reference6,4880.59480.01940.00340.50800.0380
Prompt: revise7,1140.53750.00670.00820.49930.0133
Prompt: rewrite3,7260.43300.00320.00480.49920.0064
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.62140.02140.00560.50790.0418
Model: claude-opus-5 (Temp: Unknown)2,4400.51040.00490.00570.49960.0097
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.45850.00630.00550.50040.0125
❗ Model: gemini-3.8-flash (Temp: Unknown)2,5540.41190.00160.00630.49770.0031
Model: gpt-5.4 (Temp: Unknown)2,4040.58670.00920.00830.50040.0180
Model: gpt-5.6-sol (Temp: Unknown)2,5120.57050.00800.00640.50080.0157
Model: grok-4.3 (Temp: Unknown)2,2680.44300.00710.00350.50180.0140
Model: kimi-k3 (Temp: Unknown)2,3600.58780.03220.00590.51310.0620
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.63990.01940.00590.50670.0378
Model: qwen3.7-max (Temp: Unknown)2,5620.44790.00620.00620.50000.0123
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 4.7220.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Perplexity (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.48600.00960.01000.49980.0189
Prompt: direct_reference7,1900.45030.00970.01200.49890.0191
Prompt: indirect_reference6,4880.55630.01600.00650.50480.0314
Prompt: revise7,1140.49630.00620.01270.49680.0121
Prompt: rewrite3,7260.41420.00480.00750.49870.0095
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.56170.01670.01190.50240.0324
Model: claude-opus-5 (Temp: Unknown)2,4400.49480.00410.00900.49750.0081
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.40220.00550.00950.49800.0109
❗ Model: gemini-3.8-flash (Temp: Unknown)2,5540.36440.00230.00940.49650.0046
Model: gpt-5.4 (Temp: Unknown)2,4040.55770.00750.01080.49830.0147
Model: gpt-5.6-sol (Temp: Unknown)2,5120.55630.00880.01190.49840.0172
Model: grok-4.3 (Temp: Unknown)2,2680.40840.00710.00710.50000.0139
Model: kimi-k3 (Temp: Unknown)2,3600.54150.02370.00850.50760.0460
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.59310.01430.01010.50210.0279
Model: qwen3.7-max (Temp: Unknown)2,5620.39130.00700.01170.49770.0138
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 3.9421.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.53970.01880.00900.50490.0365
Prompt: direct_reference7,1900.52530.02360.01080.50640.0457
Prompt: indirect_reference6,4880.60560.03050.00520.51260.0589
Prompt: revise7,1140.54680.00980.01070.49960.0193
Prompt: rewrite3,7260.43960.00590.00860.49870.0116
✔️ Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.63260.04130.00950.51590.0786
Model: claude-opus-5 (Temp: Unknown)2,4400.51810.00740.00740.50000.0145
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.46130.00950.00950.50000.0187
❗ Model: gemini-3.8-flash (Temp: Unknown)2,5540.43700.00780.00860.49960.0154
Model: gpt-5.4 (Temp: Unknown)2,4040.58930.01750.01000.50370.0340
Model: gpt-5.6-sol (Temp: Unknown)2,5120.61270.01590.01040.50280.0310
Model: grok-4.3 (Temp: Unknown)2,2680.47500.00880.00710.50090.0174
Model: kimi-k3 (Temp: Unknown)2,3600.57890.03810.00850.51480.0729
Model: minimax-m3 (Temp: Unknown)2,3760.61830.03280.00840.51220.0631
Model: qwen3.7-max (Temp: Unknown)2,5620.47820.00940.01010.49960.0184
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.4637.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Entropy (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.47200.00930.01140.49890.0182
Prompt: direct_reference7,1900.41600.00780.01340.49720.0153
Prompt: indirect_reference6,4880.52580.01480.00830.50320.0289
Prompt: revise7,1140.49670.00730.01380.49680.0143
Prompt: rewrite3,7260.44100.00640.00860.49890.0127
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.54110.01750.01350.50200.0339
Model: claude-opus-5 (Temp: Unknown)2,4400.47440.00490.01070.49710.0097
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.40740.00710.01030.49840.0140
Model: gemini-3.8-flash (Temp: Unknown)2,5540.41230.00390.00940.49730.0077
Model: gpt-5.4 (Temp: Unknown)2,4040.52470.00830.01250.49790.0163
✔️ Model: gpt-5.6-sol (Temp: Unknown)2,5120.54350.00800.01350.49720.0156
❗ Model: grok-4.3 (Temp: Unknown)2,2680.37970.00620.00970.49820.0122
Model: kimi-k3 (Temp: Unknown)2,3600.49790.01440.01020.50210.0281
Model: minimax-m3 (Temp: Unknown)2,3760.53570.01600.01010.50290.0312
Model: qwen3.7-max (Temp: Unknown)2,5620.40650.00700.01410.49650.0138
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 1.4228.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.50090.01970.00770.50600.0384
Prompt: direct_reference7,1900.49230.02280.00640.50820.0443
Prompt: indirect_reference6,4880.48730.02280.00710.50790.0443
Prompt: revise7,1140.51270.01740.00840.50450.0340
Prompt: rewrite3,7260.51830.01290.01020.50130.0252
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.46200.01430.00950.50240.0279
Model: claude-opus-5 (Temp: Unknown)2,4400.48640.00820.00660.50080.0162
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.52390.02610.00630.50990.0507
Model: gemini-3.8-flash (Temp: Unknown)2,5540.51320.02820.00550.51140.0545
Model: gpt-5.4 (Temp: Unknown)2,4040.52060.00920.00830.50040.0180
❗ Model: gpt-5.6-sol (Temp: Unknown)2,5120.45780.01110.00880.50120.0219
Model: grok-4.3 (Temp: Unknown)2,2680.46900.02380.00880.50750.0461
Model: kimi-k3 (Temp: Unknown)2,3600.54350.02970.00850.51060.0571
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.57080.03030.00840.51090.0583
Model: qwen3.7-max (Temp: Unknown)2,5620.46620.01720.00700.50510.0335
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0312.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Top-p Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.58010.04000.00490.51750.0765
Prompt: direct_reference7,1900.62160.06540.00670.52930.1220
Prompt: indirect_reference6,4880.61980.04960.00250.52360.0943
Prompt: revise7,1140.56880.02000.00450.50770.0390
❗ Prompt: rewrite3,7260.45470.01230.00640.50300.0242
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.59410.04210.00560.51830.0804
Model: claude-opus-5 (Temp: Unknown)2,4400.57510.02050.00570.50740.0399
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.51300.01510.00400.50550.0295
Model: gemini-3.8-flash (Temp: Unknown)2,5540.46260.00630.00470.50080.0124
Model: gpt-5.4 (Temp: Unknown)2,4040.64920.03410.00580.51410.0656
Model: gpt-5.6-sol (Temp: Unknown)2,5120.62510.04060.00400.51830.0777
Model: grok-4.3 (Temp: Unknown)2,2680.58010.06080.00260.52910.1144
Model: kimi-k3 (Temp: Unknown)2,3600.62970.07120.00590.53260.1322
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.68350.09510.00670.54420.1727
Model: qwen3.7-max (Temp: Unknown)2,5620.50160.02110.00390.50860.0411
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0201.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.51320.02210.00800.50710.0429
Prompt: direct_reference7,1900.50940.03640.00830.51400.0698
Prompt: indirect_reference6,4880.57510.03110.00620.51250.0600
Prompt: revise7,1140.50770.00900.00930.49990.0177
Prompt: rewrite3,7260.42570.00380.00810.49790.0074
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.61830.04370.00790.51790.0831
Model: claude-opus-5 (Temp: Unknown)2,4400.49640.01150.00740.50200.0225
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.43370.00950.00790.50080.0187
❗ Model: gemini-3.8-flash (Temp: Unknown)2,5540.37460.00700.00780.49960.0139
Model: gpt-5.4 (Temp: Unknown)2,4040.59310.02080.00830.50620.0404
Model: gpt-5.6-sol (Temp: Unknown)2,5120.55800.01270.00800.50240.0250
Model: grok-4.3 (Temp: Unknown)2,2680.44210.01500.00620.50440.0294
Model: kimi-k3 (Temp: Unknown)2,3600.57060.04750.00930.51910.0898
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.61930.04800.00760.52020.0909
Model: qwen3.7-max (Temp: Unknown)2,5620.43540.00780.00940.49920.0153
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0295.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Top-k Outliers (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.47880.01090.00730.50180.0215
Prompt: direct_reference7,1900.46530.01700.00920.50390.0331
Prompt: indirect_reference6,4880.53950.01540.00550.50490.0302
Prompt: revise7,1140.47430.00480.00730.49870.0094
Prompt: rewrite3,7260.40960.00320.00700.49810.0064
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.56710.01430.00870.50280.0280
Model: claude-opus-5 (Temp: Unknown)2,4400.48280.00740.00660.50040.0146
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.38460.00710.00630.50040.0141
❗ Model: gemini-3.8-flash (Temp: Unknown)2,5540.33460.00550.00700.49920.0108
Model: gpt-5.4 (Temp: Unknown)2,4040.57310.01160.00670.50250.0229
Model: gpt-5.6-sol (Temp: Unknown)2,5120.54580.00560.00720.49920.0110
Model: grok-4.3 (Temp: Unknown)2,2680.41600.01060.00530.50260.0208
Model: kimi-k3 (Temp: Unknown)2,3600.53070.02800.00850.50970.0540
✔️ Model: minimax-m3 (Temp: Unknown)2,3760.58100.01850.00840.50510.0361
Model: qwen3.7-max (Temp: Unknown)2,5620.38430.00230.00860.49690.0046
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.0183.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B-Instruct)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.47900.00670.00390.50140.0132
Prompt: direct_reference7,1900.47450.00500.00330.50080.0099
Prompt: indirect_reference6,4880.47240.00370.00370.50000.0073
Prompt: revise7,1140.47060.00960.00560.50200.0188
Prompt: rewrite3,7260.51580.00970.00210.50380.0191
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.45170.00400.00400.50000.0079
Model: claude-opus-5 (Temp: Unknown)2,4400.45730.00490.00410.50040.0097
✔️ Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.54930.00870.00480.50200.0172
Model: gemini-3.8-flash (Temp: Unknown)2,5540.49520.01570.00310.50630.0307
Model: gpt-5.4 (Temp: Unknown)2,4040.44320.00330.00500.49920.0066
❗ Model: gpt-5.6-sol (Temp: Unknown)2,5120.34780.00240.00240.50000.0048
Model: grok-4.3 (Temp: Unknown)2,2680.50560.00440.00350.50040.0087
Model: kimi-k3 (Temp: Unknown)2,3600.52340.01020.00420.50300.0201
Model: minimax-m3 (Temp: Unknown)2,3760.54170.01090.00250.50420.0216
Model: qwen3.7-max (Temp: Unknown)2,5620.48110.00230.00550.49840.0046
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 3.2271.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: FastDetectGPT (Llama-3.2-3B)

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.45200.02350.00790.50780.0456
Prompt: direct_reference7,1900.41200.02480.00920.50780.0479
Prompt: indirect_reference6,4880.37200.01540.00890.50320.0301
Prompt: revise7,1140.48340.02250.00760.50750.0437
Prompt: rewrite3,7260.60900.03700.00430.51640.0711
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.41890.02300.00870.50710.0446
Model: claude-opus-5 (Temp: Unknown)2,4400.40910.01230.00820.50200.0241
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.52860.02930.00790.51070.0565
✔️ Model: gemini-3.8-flash (Temp: Unknown)2,5540.70420.08140.00700.53720.1496
Model: gpt-5.4 (Temp: Unknown)2,4040.33820.00750.00920.49920.0147
Model: gpt-5.6-sol (Temp: Unknown)2,5120.42710.01510.00800.50360.0296
Model: grok-4.3 (Temp: Unknown)2,2680.43450.01410.00790.50310.0276
Model: kimi-k3 (Temp: Unknown)2,3600.34650.01190.00680.50250.0233
❗ Model: minimax-m3 (Temp: Unknown)2,3760.31150.01090.00590.50250.0215
Model: qwen3.7-max (Temp: Unknown)2,5620.57120.02500.00940.50780.0483
Thresholding:
  • Direction: lower_is_ai
  • Swept for fpr_0_5pct with a found threshold of -2.8000.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]

Classifier: Binoculars

Performance:
SubsetNAUROCTPRFPRAccuracyF1
Overall24,5180.62010.04480.00330.52080.0855
Prompt: direct_reference7,1900.67060.05560.00330.52610.1051
Prompt: indirect_reference6,4880.60770.03880.00340.51770.0745
Prompt: revise7,1140.60870.04020.00280.51870.0771
Prompt: rewrite3,7260.56620.04290.00380.51960.0821
Model: claude-opus-4-5-20251101 (Temp: Unknown)2,5180.66090.04920.00320.52300.0936
Model: claude-opus-5 (Temp: Unknown)2,4400.54850.00980.00330.50330.0194
Model: gemini-3.1-pro-preview (Temp: Unknown)2,5240.63200.04200.00320.51940.0804
Model: gemini-3.8-flash (Temp: Unknown)2,5540.65200.08300.00310.53990.1528
Model: gpt-5.4 (Temp: Unknown)2,4040.61030.01500.00330.50580.0294
Model: gpt-5.6-sol (Temp: Unknown)2,5120.65930.03980.00400.51790.0763
Model: grok-4.3 (Temp: Unknown)2,2680.64190.06790.00440.53170.1266
Model: kimi-k3 (Temp: Unknown)2,3600.56090.02970.00340.51310.0574
❗ Model: minimax-m3 (Temp: Unknown)2,3760.53540.01600.00170.50720.0314
✔️ Model: qwen3.7-max (Temp: Unknown)2,5620.68870.09130.00310.54410.1669
Thresholding:
  • Direction: higher_is_ai
  • Swept for fpr_0_5pct with a found threshold of 0.9673.

[image]

Classification Histograms:

[image]

Per Prompt Subset

[image] [image] [image] [image]

Per Generator Config Subset

[image] [image] [image] [image] [image] [image] [image] [image] [image] [image]