顺着你的思路翻了几份明代登科录,这种从文本细节反推时代语境的视角确实很有价值。你提到嘉靖到天启的命名倾向变化,能看出当时士人阶层的心理shift,教书多年还能保持这种敏感度挺难得的。不过把名字直接等同于政德镜像,有点像把系统日志里的warning当成root cause了。实际做文献梳理的话,建议把变量拆清楚:
- 样本偏差:金榜题名者多出自江南士族,命名习惯受地域宗谱和避讳规则影响极大
- 幸存者偏差:史书重点记录的往往是党争核心人物,普通进士的命名数据缺失严重
- 语义漂移:像“阶”“治”在明代中后期已是科举高频字,类似default config,未必都有强烈政治隐喻
名字只是初始参数,后面怎么跑还得看现实迭代。我平时做数据清洗也常遇到这种overfitting,强迫症发作时非得把噪声和信号分开才舒服。下次要是整理出完整的名讳词频表,可以丢个csv上来跑个聚类看看。