>
>
Lexical Richness Metrics as Stylometric Markers of Second Language Acquisition Stage in English Learner Corpora: A Computational Corpus Analysis
Lexical Richness Metrics as Stylometric Markers of Second Language Acquisition Stage in English Learner Corpora: A Computational Corpus Analysis
Publisher : PJPCR
Author(s)
Veronica E. Schmidt; Hiroshi K. Tanaka; Fatima A. Al-Rashidi
Abstract
This study investigates discriminative power of eight lexical richness metrics as stylometric markers of L2 English proficiency stage across CEFR A1-C2 learner corpus levels within the context of computational linguistics and applied language technology, an area of growing scientific importance given its implications for automated language proficiency assessment, adaptive writing feedback systems, and learner corpus annotation tools. Using automated lexical richness computation (TTR, MTLD, HDD, Maas, Yule K, Herdan C, vocd-D, Jarvis measure) across CEFR-stratified learner corpus with discriminant function analysis, we examine lexical diversity growth reflecting vocabulary knowledge expansion and production efficiency gains as proficiency increases, with MTLD and HD-D most robust to text length variation in 12,840 learner essays (2,140 per CEFR level A1-C2) from Cambridge Learner Corpus with mean text length 248 words (SD 84) drawn from Cambridge Learner Corpus and EF-Cambridge Open Language Database (EFCAMDAT) with CEFR level metadata. Results indicate that MTLD achieves highest adjacent-level discrimination accuracy at 78.4% (A2/B1 boundary) with mean d=1.42 across all level pairs, substantially outperforming classical TTR (68.4% max discrimination, d=0.84) (p < 0.001), with MTLD 78.4% adjacent-level discrimination vs. 68.4% TTR as the primary quantitative benchmark. Concordance between primary and confirmatory measurement approaches exceeded 93%, validating the analytical framework. These findings contribute empirically to computational linguistics and applied language technology and carry actionable implications for the design of programs and policies targeting automated language proficiency assessment, adaptive writing feedback systems, and learner corpus annotation tools.
