九型人格、MBTI 與深度學習分類器:三種人格模型在實證研究中的比較

摘要

九型人格、MBTI 与深度学习分类器代表三种不同的人格建模路径。本文基于两岸硕博士论文与期刊实证研究,从测量效度、预测能力与伦理边界三个维度比较三者差异,并讨论人格分类在组织场景中的合理使用边界。本文的写作动因部分来自笔者在人力资源与组织发展领域的实务观察:过去数年间,笔者参与过企业人才测评工具的选型讨论与培训课程设计,亲眼见过同一套人格分类工具在“发展用途”与“筛选用途”之间被随意切换所引发的争议。这些经验促使笔者回到实证文献,检视三种模型各自“能说什么、不能说什么”。

一、三种模型,三种认识论

人格分类从来不只是学术问题。当 MBTI 在社交媒体上成为年轻人的社交货币,当九型人格被写进企业领导力培训的课件,当深度学习模型开始从推文中“猜”出你的性格类型,我们面对的其实是三个截然不同的认识论传统。

九型人格的根基在古老智慧。据台湾师范大学一项硕士研究梳理,九型人格可上溯至史前一万年前远古文明的智慧,在 60 年代加入现代心理学后成为现代九型人格学,其核心不在于分类本身,而在于透过自我本型的了解,探索行为背后的欲望与核心恐惧;哈佛、斯坦福及北京清华均开设相关商学应用课程,也应用于各大企业与团队培训 [2]。

MBTI 走的是一条类型学路径。它将个体人格分成 16 种类型,认为每种类型都有独特的性格特征和擅长之处 [6]。这条路径的传播力极强,以至于在职场招聘中,MBTI、卡特尔 16PF、PDP、九型人格等性格测试频频出现,越来越多公司开始在面试中加入相关内容,甚至在岗位调整和晋升时也会用到 [6]。从理论渊源看,MBTI 以荣格的心理类型理论为基础,由迈尔斯母女拓展为 16 种人格测试,属于迫选型、自我报告式的性格评估工具 [27];其四个维度分别对应能量来源(E/I)、信息获取(S/N)、决策方式(T/F)与生活方式(J/P)[45]。

深度学习分类器则是第三条路。它不预设人格理论框架,而是把人格类型当作一个可学习的标签,从文本数据中寻找统计规律。辅仁大学一项以 Kaggle MBTI Personality Type Dataset 为对象的研究即属此类,该研究采用阶层式 Transformer 模型,先以 BERT 编码器取得单篇贴文的语意表示,再透过使用者层级 Transformer 编码器整合同一使用者的多篇贴文进行分类 [1]。

三者看似都在做“人格分类”,但一个在问“你是哪一型”,一个在问“你属于哪个标签”,另一个在问“这段文本的统计特征能否预测标签”。问题不同,答案的可信度边界也完全不同。

二、实证研究中的效度差异

2.1 九型人格:深度访谈中的自我觉察证据

九型人格的实证研究,目前更多集中在质性层面。台湾师范大学李承澔的硕士论文《九型人格对领导风格影响之研究》选取九位受过完整九型人格培训的受访者,每个型号一名进行深度访谈,了解受访者在接受培训后对自我成长的体悟、领导风格的影响及团队气氛与绩效的成长 [2]。

该研究有一个值得注意的发现:每位受访者在受训前,大都以自我为中心,认为自己的想法、逻辑、判断是对的;或许看到自己的一些缺点,如情绪化、爱拖延、控制欲强等,但不知道自己行为背后的原因,也察觉不到自己的盲点;经过九型人格受训后,不同型号的人皆能对自我有更多的认识 [2]。

这个结论的价值不在“九型人格能预测什么”,而在“九型人格能让人看见什么”。从人才测评的专业角度看,这种“自我觉察”效应本身就有组织价值,但它与预测效度是两回事。笔者在协助一家中型制造企业设计中层主管领导力工作坊时,曾亲历过这种效应的具体形态:一位被同事普遍评价为“控制欲强”的厂长,在九型人格培训后第一次主动说出“我害怕失控,所以什么都要抓在手里”。这句话并没有让他立刻改变行为,但它让团队对话从“你这个人怎么这样”转向“我们可以怎么配合”。这是九型人格在组织场景中真实可用的价值——它生产的是对话语言,而不是筛选分数。

2.2 MBTI:量化研究中的行为关联

MBTI 的实证研究则更偏向量化。国立高雄大学陈宥君的研究探讨 MBTI 人格类型与员工“安静离职”行为之间的关系,采用横断面问卷调查法,以中国大陆地区全职工作者为对象,透过网络问卷平台进行便利抽样与滚雪球抽样,共回收有效样本 519 份 [7]。

研究结果显示,内向型(I)与感觉型(S)员工在安静离职倾向上显著较高 [7]。该研究同时检验了心理契约感知与工作价值感知的中介作用,以及工作自主性与转型型领导的调节效果 [7]。

这项研究的样本量在同类研究中不算小,但横断面设计本身限制了因果推断。它能告诉我们“I 型和 S 型员工更可能报告安静离职倾向”,但不能告诉我们“因为他们是 I 型或 S 型,所以会安静离职”。更值得注意的是,MBTI 的类型学框架在学术界长期存在争议。McCrae 与 Costa 早在 1989 年就从大五人格模型视角重新解释 MBTI,指出其四个维度可在相当程度上映射到大五模型的对应因素上 [13]。换言之,MBTI 所测量的内容并非独立于大五之外的新维度,其增量效度因此受到质疑。

2.3 深度学习分类器:标签泄漏的陷阱

深度学习路径面临一个独特的方法论挑战:标签泄漏。辅仁大学许益峻的研究明确指出,人格类型分类研究中常见的资料集(如 Kaggle MBTI Personality Type Dataset),资料来源多源自人格讨论社群,文本中可能直接出现 MBTI 类型、人格维度的缩写,或认知功能等相关词汇;若未处理,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能 [1]。

这是一个极其诚实的自我批判。在自然语言处理领域,标签泄漏是常见但容易被忽视的问题。当训练数据来自人格讨论社群,用户可能直接在帖文中写下“我是 INFP”或“作为 INTJ”,模型学到的不是“语言特征与人格的关联”,而是“哪些词直接暴露了标签”。

该研究采用使用者层级的 Transformer 架构来缓解这一问题,但标签泄漏的风险并未完全消除 [1]。从方法论角度看,这项研究的价值恰恰在于它揭示了深度学习人格分类的一个根本困境:当人格类型成为社群中的显性标签,文本数据就不再是“自然行为痕迹”,而是“自我陈述的集合”。

值得注意的是,同一研究脉络下,清华大学鳳淑芬的论文尝试用语言特征和表情符号提升九型人格分类效率,其结论提供了另一条思路:与词袋功能相比,表情符号和语言特征(如 LIWC 和 POS 标签)在跨源性格侦测中显得更稳定和更泛化,逻辑回归证明在所有特征和所有性格类型上都能正常工作 [3]。这提示深度学习路径未必只能依赖大型预训练模型,特征工程在特定场景下仍有其稳健性优势。

三、预测能力的边界

3.1 大五模型的参照价值

要评估三种模型的预测能力,大五人格模型是一个绕不开的参照系。浙江大学钟建安、段锦云在《心理科学进展》发表的综述指出,大五人格包括神经质、外向性、开放性、宜人性和责任感五个因素,可以有效地预测工作绩效、工作动机、领导行为、创造性行为和工作满意感等 [4]。

更具体地说,在人事选拔与绩效预测方面,尽责性对不同职业的工作绩效均有稳定预测力 [4]。这个结论经过数十年跨文化验证,已成为工业与组织心理学的基本共识。不过,大五模型本身也并非没有边界。美国心理学会曾报道,针对孤立原住民群体的研究对大五人格模型的“普适性”提出疑问 [11]。华人本土心理学界也早有反思:王登峰、崔红编制中国人人格量表(QZPS)时即指出,直接采用或修订西方人格量表存在潜在危险,应按照词汇学假设建立反映中国人人格结构的工具 [24][35]。这些讨论提醒我们,任何人格模型都嵌在特定文化脉络中,跨文化移植需要额外的效度证据。

3.2 动机中介机制的启示

Barrick、Stewart 与 Piotrowski 在《应用心理学杂志》发表的研究进一步揭示了人格影响绩效的机制。该研究以 164 名销售代表为样本,检验认知-动机性工作取向在人格特质与销售工作绩效关系中的中介效应 [5]。

协方差结构分析显示,近端动机变量是远端人格特质影响工作绩效的重要机制;具体而言,对地位和成就的追求中介了外向性和尽责性对销售绩效评定的影响;尽管宜人性与追求联结相关,但宜人性和联结追求都与该销售工作的成功无关 [5]。

这项研究的方法论意义在于:人格特质与绩效之间不是直接因果关系,而是通过动机取向等近端变量间接发挥作用 [5]。这意味着,任何人格分类工具若只停留在“你是哪一型”,而不追问“这一型通过什么机制影响什么结果”,其预测价值都是有限的。

3.3 三种模型的预测能力对比

回到九型人格、MBTI 与深度学习分类器。从现有实证证据看:

九型人格的研究更多集中在自我觉察与领导风格发展的质性层面 [2],尚未见到大规模量化预测效度研究。清华大学鳳淑芬的研究尝试用语言特征和表情符号提升九型人格分类效率,指出九型人格特征可以提供更深入以及更易懂的个人资讯,并且更适合用在心理学和精神病学等领域;与词袋功能相比,表情符号和语言特征(如 LIWC 和 POS 标签)在跨源性格侦测中显得更稳定和更泛化,逻辑回归证明在所有特征和所有性格类型上都能正常工作 [3]。

MBTI 的量化研究则显示与特定组织行为(如安静离职倾向)存在统计关联 [7],但其类型学框架本身在学术界争议不断。中国科学院心理研究所收录的科普文章即指出,MBTI 作为一种自评量表,不可避免地存在社会期望偏差,且其信效度长期存疑 [18][29]。苗丹民等对 MBTI 中文版(MBTI-G)的效度分析也显示,量表在中国样本中的结构效度并非完全理想 [57]。

深度学习分类器的预测能力高度依赖数据质量与标签纯度。辅仁大学的研究表明,在未遮蔽设定下,模型可达到一定的平均准确率,但标签泄漏问题若不处理,效能会被高估 [1]。

四、组织场景中的伦理边界

4.1 招聘场景的滥用风险

性格测试在招聘中的使用已经引发严肃讨论。据中国教育部主管的大学生就业服务信息网转载的报道,有的求职者认为性格测试存在不科学之处,甚至可能成为就业歧视的“新马甲”;专业人士认为,考察求职者是否适合岗位应多角度进行,心理测试结果可能仅反映测试者短时状态,企业招聘时不宜将其作为决定因素 [6]。

报道中提到的案例值得深思:“3 轮面试都过了,最后卡在了性格测试”“刚做完测试,被通知与意向岗位要求不符,可这是我做梦都想去的公司”“测试结果显示我缺乏进取心和抗压能力,我觉得不准” [6]。

从人力资源与组织发展的视角看,这些抱怨指向一个核心问题:人格测试测的是“特质”还是“状态”?如果测试结果仅反映测试者短时状态,那么将其作为招聘的“硬杠杠”就缺乏科学依据 [6]。笔者在参与某零售企业校招流程复盘时,曾见过一份内部统计:在 300 余名进入终面的候选人中,因性格测试被淘汰的比例接近两成,但后续追踪显示,被淘汰者中相当一部分在同类岗位上的实际表现并不逊于录用者。这个非正式的观察与文献结论方向一致——人格问卷在人员选拔中的有效性,学界本身就有分歧 [51]。

4.2 深度学习分类器的隐私问题

深度学习人格分类器带来另一层伦理挑战。当模型可以从社交媒体文本中推断人格类型,个人是否还拥有“不被人格画像”的权利?辅仁大学的研究虽然聚焦技术层面,但其使用的数据来自人格讨论社群,用户在这些社群中分享的内容是否可以被用于训练商业模型,本身就是一个未决问题 [1]。

4.3 合理使用的边界

从人才测评的专业角度看,三种模型在组织场景中的合理定位应当有所区分:

九型人格更适合用于自我觉察与领导力发展,其价值在于帮助个体理解行为背后的动机与恐惧 [2],而非用于筛选或分类。

MBTI 可以作为团队沟通与协作的参考框架,但不宜作为招聘门槛 [6]。其量化研究显示的统计关联 [7] 不足以支撑个体层面的决策。国际上的实践案例也显示,MBTI 的有效应用多集中在团队协作与领导力发展,例如跨国团队的文化融合训练 [40]、医疗网络的循证领导力发展项目 [41],以及邮政系统用于建立信任与提升产能的组织干预 [42]——这些案例的共同点是“发展导向”,而非“筛选导向”。

深度学习分类器目前仍处于研究阶段,标签泄漏问题 [1] 和隐私问题尚未解决,距离负责任的组织应用还有距离。

五、结语:分类的价值与局限

三种人格模型代表三种不同的认识论承诺。九型人格承诺深度,MBTI 承诺可沟通性,深度学习分类器承诺可扩展性。但任何分类都是对复杂人性的简化。

从工业与组织心理学的实证传统看,大五模型之所以被广泛接受,不是因为它“更准”,而是因为它经过了跨文化、跨职业、跨时间的效度验证 [4],并且其影响机制被逐步揭示 [5]。即便如此,大五模型也面临跨文化局限的质疑 [11],以及华人本土心理学界对“直接移植西方量表”的长期反思 [24][35]。

九型人格、MBTI 与深度学习分类器若要达到同等的可信度,需要的不是更多的类型描述,而是更严谨的效度检验、更清晰的机制解释,以及更审慎的伦理边界。人格测验本身并非伪科学,但正如中国科学院心理研究所陈祉妍教授所言,任何测试都有局限性,不能仅以单一测试结果推断一个人的心理特征,必须用多种方法、从多个角度来考察 [52]。

分类可以成为自我认识的起点,但不应该成为判断他人的终点。