Companion study: ai-halo-valuation-bias — Another industry leading model panel, testing context-driven price valuation instead of author attribution.
Methodology & Findings
This repository contains a six-model study evaluating author-age misattribution, miscalibrated confidence, and post-hoc confession without correction. The experiment measures text-only performance and confidence tracking across frontier large language models.
- Sample Size: N = 3,225 scored attributions
- Models Evaluated: 6 frontier Large Language Models
- Key Focus: Text-only study evaluating model calibration and text-only NLP performance
Project Structure
scripts/: Python execution scripts for running model evaluations.analysis/: Data processing and metric evaluation scripts.human-baseline/: Experimental protocol for human-rater baseline comparison.
Further Reading
- Six AI Models. Six Ways to Fail. (Substack) — Behavioral failure fingerprints and calibration tracking data.