2025Completed
MERIT: Mechanistic Explainability of Reasoning Integrity and Transparency
Mechanistic interpretability framework for identification of domain-specific reasoning features over varying task complexities.
Developed six metrics to quantitatively track LLM reasoning output quality
Identified feature fracturing behavior into specialized sub-domains over increasing task difficulty
Discovered discrete feature-controlled reasoning modalities (e.g. calculative vs verbose) and demonstrated steering efficacy
Mechanistic InterpretabilityAI AssuranceLLM Reasoning