当 Transformer 读心:MBTI 人格分类的深度学习方法解读

摘要:社群文本能否预测 MBTI?本文从一篇硕士论文出发,拆解 BERT 加用户层级 Transformer 的阶层式建模思路,并讨论标签泄漏、效度边界与人才测评场景中的适用限度。

一、为什么研究者盯上了 MBTI 文本分类

MBTI 经由社群媒体与网络平台广泛传播,已成为大众自我探索与社交互动时常见的人格分类工具[1]。从人才测评的专业视角看,这类工具的流行度与它的科学地位之间存在明显落差:它被大量企业用于招聘筛选,却也被专业人士提醒,心理测试结果可能仅反映测试者短时状态,企业招聘时不宜将其作为决定因素[4]。

正是这种“高传播、低门槛”的特征,让 MBTI 成为自然语言处理领域一个方便获取标签的数据场景。随着自然语言处理与深度学习技术发展,利用社群贴文进行人格类型预测逐渐受到关注[1]。公开研究中被反复使用的数据集之一,其文本来自人格讨论社群,天然带有大量自我描述与类型讨论。

但便利往往伴随着陷阱。一篇相关硕士论文的核心贡献恰恰在于把这个陷阱摆到了台面上[1]。

二、阶层式 Transformer:先读帖子,再读人

2.1 单篇帖子不足以定义一个人

如果只用一条贴文预测人格,模型面对的是一段几十到几百字的短文本,信息量稀薄。更合理的假设是:一个人的多篇贴文合起来,才构成可用的行为样本。

该研究因此以使用者为单位,采用阶层式 Transformer 模型进行分类:先以 BERT 编码器取得单篇贴文之语意表示,再透过使用者层级 Transformer 编码器整合同一使用者多篇贴文[1]。这个两段式结构把任务拆成了“句子级语义抽取”和“用户级表征聚合”两层,前者复用预训练语言模型的通用能力,后者学习如何把散落的多条发言拼成一个稳定的人格画像。

从建模逻辑上看,这一设计隐含了一个可检验的假设:人格信号在单条文本中稀疏、在用户级聚合中才趋于稳定。换言之,模型性能的提升应当主要来自第二层聚合,而非第一层编码——如果消融实验显示去掉用户层级编码器后性能大幅下降,这一假设才得到支持。论文摘要未披露此类消融结果,因此该假设目前仍属设计动机层面的推断,而非已验证的结论。

2.2 为什么是 Transformer 而不是词袋

从方法演进的角度看,这一步并不意外。较早的人格分类研究更多依赖词袋与浅层特征。有硕士论文就对比过:与词袋功能相比,表情符号和语言特征(如语言查询和单词计数 LIWC 与词性标签 POS)在跨源性格侦测中显得更稳定、更泛化,逻辑回归在所有特征和所有性格类型上都能正常工作[2]。

这说明两件事:其一,浅层语言特征确实携带人格信号;其二,它们的泛化能力有限。Transformer 的价值在于用上下文相关的表示替代离散特征,理论上更能捕捉“同一句话在不同语境下含义不同”的现象。但这也意味着模型更依赖数据规模与数据质量——而这正是下一个问题。

三、标签泄漏:一个被低估的效度威胁

3.1 文本里藏着答案

该研究明确指出:人格类型分类研究中,常见的数据集(如本研究使用的 Kaggle MBTI Personality Type Dataset)资料来源多源自人格讨论社群,文本中可能直接出现 MBTI 类型、人格维度的缩写,或认知功能等相关词汇[1]。

这句话值得反复读。如果一条贴文里写着“作为 INFP 我真的……”,那么模型要做的不是推断人格,而是识别字符串。若未处理,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能[1]。

3.2 从测评视角看这意味着什么

在人才测评的专业语境里,这类似于“题目本身泄露了答案”。一个测量工具如果让受测者在作答时直接看到维度名称,效度就无从谈起。文本分类中的标签泄漏是同一逻辑的技术版本:模型报告的高准确率,可能只是它学会了找关键词,而非学会了理解人。

论文摘要提到,实验结果显示在 unmasked 设定下模型平均 Accuracy 为 0.6537、Macro F1-score 为 0.5414、Weighted F1-score 为 0.6493[1]。这里的关键词是“unmasked”——它提示研究者在实验设计中区分了是否遮蔽显性线索的条件。需要指出的是,本文仅引用了 unmasked 条件下的结果,论文摘要未同时披露 masked 条件下的对应数字,因此无法判断遮蔽显性线索后性能下降的幅度,也就无法评估模型在多大程度上依赖了标签泄漏。对读者而言,真正需要记住的不是某个具体数字,而是:任何人格分类模型的性能报告,都必须同时交代 masked 与 unmasked 两组结果,以及它如何处理标签泄漏。

四、人格分类的效度边界:不止是技术问题

4.1 类型学工具的固有争议

MBTI 将个体人格分成 16 种类型,认为每种类型都有独特的性格特征和擅长之处[4]。它的理论基础源自荣格的心理类型理论,后经迈尔斯和布里格斯增加一个维度,构成 16 种人格类型,每种类型用 4 个字母表示[14][15]。

但类型学取向本身在心理测量学上一直有争议:把人切成离散类别,会损失连续维度上的信息。这一争议涉及几个可操作的心理测量学指标:其一是重测信度——同一受测者隔一段时间重测,类型归属是否稳定,若大量受测者在四个维度上发生翻转,类型的稳定性就存疑;其二是结构效度——16 个离散类型是否能被数据支持,还是连续维度上的切分更符合实证结构;其三是与五因素模型的对比——大五人格以连续维度刻画个体差异,在预测效度上积累了大量证据,类型学工具在这方面的可比证据相对有限。这也是为什么九型人格研究者在论证自身价值时会强调,五大性格特质模型和 MBTI 是常见选择,但它们仅适用于某些行业,例如教育、商业;九型人格特征可以提供更深入以及更易懂的个人资讯,并且更适合用在心理学和精神病学等领域[2]。

4.2 模型预测的到底是什么

这是我在看这类研究时最关心的问题。模型学到的可能是:

  • 稳定的语言习惯(用词偏好、句法复杂度);
  • 社群身份信号(某个板块的发言风格);
  • 自我标签的复述(即标签泄漏)。

三者混杂在一起,报告的准确率无法区分它们。要分离这些成分,需要跨源验证。前述九型人格研究采用的正是跨源性格侦测思路,并发现表情符号与语言特征比词袋更稳定[2]。这提示:真正有价值的人格计算研究,不是在同一数据分布内刷分,而是在分布外仍站得住。

五、从招聘场景反推:这类模型该用在哪

5.1 企业已经在用性格测试,但用法存疑

近年来,MBTI、卡特尔 16PF、PDP、九型人格等性格测试在职场招聘中频频出现,越来越多公司开始在面试中加入相关内容,甚至在岗位调整和晋升时也会用到,有企业还提出性格测试不通过一年内不能再投简历的要求[4]。

有求职者因测试结果不合格错失心仪岗位,也有人质疑其不科学、不公平;企业则认为性格测试能帮助深入了解应聘者的心理素质、提升招聘效率[4]。这种分歧本身就说明:工具被赋予了超出其证据基础的决策权重。

5.2 文本模型会放大这个问题

如果企业进一步采用“分析候选人社群文本自动推断人格”的方案,风险不是更小而是更大:标签泄漏会让系统看起来准确,短时状态会被误读为稳定特质,而候选人几乎没有申诉渠道。

从组织发展的实务角度看,更稳妥的定位是把这类模型用作辅助线索生成,而非筛选门槛。它可以提示“这位候选人的公开表达偏向内向风格”,但不能替代结构化面试、工作样本测试与试用期观察。性格测试结果可能仅反映测试者短时状态,这一提醒同样适用于任何基于文本的推断[4]。

六、方法之外:人格研究需要更多一手证据

6.1 人格特质与真实结果变量的关联

技术模型的价值最终要回到“预测什么”。在这方面,传统心理学研究提供了参照。一篇以高雄市立海青工商学生为对象的硕士论文,探讨了人口变项、人格特质(人格内外向倾向、生活适应性、情绪稳定性)、情绪智力与学习成就之间的关系,发现人口变项中性别、父母婚姻状况、母亲职业、父母管教态度、科别对人格特质有影响,其余影响性并不大[3]。

另一项以 841 名大学生为对象的调查则显示,内向性格学生在“组织与逻辑”与“计划与执行”两种学习风格上皆显著高于非内向性格学生,但在“创意与开放”以及“直觉”两种学习风格上无显著差异[5]。这些发现说明:人格维度与行为结果之间的关联是具体而有限的,不是“类型决定一切”。

6.2 类型标签的自我实现风险

更值得警惕的是标签的反身性。科普文章在讨论“I 人如何化身社交 E 人”时提到,社交焦虑的人会把想象的负面评价内化,当有人认为自己不受欢迎时,周围的人也会留意到这点,于是这句话就变成了“自我实现的预言”[15]。

如果一个人格分类模型被用于向用户反馈“你是 I 人”,它可能不只是描述,而是在塑造。需要说明的是,这一判断属于基于社会心理学中自我实现预言机制的推断,而非来自该论文的实证发现——论文本身并未检验标签反馈对用户行为的长期影响。这是纯技术指标无法捕捉的伦理维度。

七、结论与局限

这篇论文的方法路径是清晰的:以使用者为单位、阶层式 Transformer、并正视标签泄漏[1]。它代表了一个正确的问题意识——人格分类的瓶颈不在模型容量,而在数据与效度。

但必须如实说明局限:由于公开资料中缺乏该类模型在真实招聘或临床场景中的一手部署案例,本文关于应用边界的讨论属于机制层面的专业判断,而非实证结论。同样,论文摘要未披露完整的混淆矩阵、跨源验证结果以及 masked 与 unmasked 的对比数据,因此无法评估其泛化能力,也无法判断模型对标签泄漏的依赖程度。

对从业者而言,可操作的结论有三条:第一,看到人格分类准确率时,先问标签泄漏如何处理,并要求同时看到 masked 与 unmasked 两组结果;第二,把文本推断定位为线索而非判决;第三,任何人格标签都应附带“不要标签化”的提醒——正如一份校园科普所写的,无论是 MBTI 或是其他人格测试,最终的指向都是给我们一个机会更好地了解自己[14]。