从九型人格到 MBTI 的机器分类:语言特征与表情符号如何被用来判断人格类型,这对职场测评意味着什么

摘要

人格测评正从"填问卷"走向"读痕迹"。研究显示,表情符号与语言特征在跨源人格识别中比词袋模型更稳定 [1]。当机器能从聊天记录推断九型人格或 MBTI 类型,职场测评的伦理边界与技术效度正面临双重拷问。本文结合一项九型人格机器分类的硕士研究、MBTI 的测量学争议,以及职场测评的实务经验,讨论三个问题:机器分类的技术可行性、它所依赖的人格理论是否稳固、以及组织在什么条件下才应该把它用于人事决策。

一、当测评不再需要你"作答"

传统人格测评有一个默认前提:你必须先知道自己在被测量,然后主动作答。无论是九型人格的深度访谈,还是 MBTI 的自陈式问卷,被测者始终是清醒的参与者。但过去十年里,自然语言处理领域的研究正在打破这个前提。

以国立清华大学的一篇硕士论文为例,研究者凤淑芬提出了基于九型人格特征的人格分类框架,目标是实现自动性格侦测,并理解不同性格类型用户在线上互动中的行为模式 [1]。这项研究的核心发现是:与传统的词袋模型相比,表情符号和语言特征——包括语言查询与单词计数(LIWC)以及词性标签(POS 标签)——在跨源人格侦测中表现得更稳定、更泛化,逻辑回归被证明在所有特征和所有性格类型上都能"正常工作" [1]

换句话说,机器判断你是什么人格类型,不需要你填任何问卷。它只需要你写过的话、用过的表情。

这背后的逻辑并不复杂。九型人格理论认为,不同人格类型的核心恐惧与欲望会渗透进日常行为,包括语言选择 [1]。一个习惯使用大量表情符号来缓和语气的人,与一个偏好纯文本、句式简洁的人,在统计上可能呈现出不同的人格倾向。而 LIWC 这类工具,本质上就是把语言拆解成可量化的维度——代词使用频率、情绪词密度、认知加工词比例——再与人格标签做关联。

值得注意的是,这项研究选择九型人格而非大五人格或 MBTI 作为分类框架,理由在于该论文作者主张九型人格能提供更深入、更易懂的个人信息,更适合心理学和精神病学等领域 [1]。但这也意味着,机器分类的效度高度依赖于它所采用的人格理论本身是否经得起推敲。

二、MBTI 的"科学外衣"与它的裂缝

要理解机器分类的局限,必须先看清 MBTI 自身的底子。

MBTI 的全称是迈尔斯—布里格斯性格分类指标,由美国作家伊莎贝尔·布里格斯·迈尔斯和她的母亲凯瑟琳·库克·布里格斯在 20 世纪 40 年代编制,是一种自我报告式的人格测评工具 [4][5]。它的理论基础源自荣格的心理类型理论——据资料记载,荣格在 20 世纪 20 到 30 年代出版的《心理类型》中对人格进行了类型划分,内向与外向这对概念就出自此书 [4]。后来迈尔斯和布里格斯增加了一个维度,构成了 16 种人格类型,每种类型用四个字母表示 [3]

这里有一个常被忽略的细节:迈尔斯母女都不是心理学博士。MBTI 官方机构 The Myers-Briggs Company 在一篇回应常见批评的文章中坦承,"布里格斯和迈尔斯都不是心理学家"——凯瑟琳·布里格斯取得的是学士学位 [29]。这并不自动否定 MBTI 的价值,但它解释了为什么 MBTI 从诞生起就更像一套面向大众的类型叙事,而非严格的心理测量学产品。

从传播角度看,MBTI 无疑是一个成功产品。据科技日报报道,在微博,与 MBTI 相关的话题阅读量高达 8 亿;各大线上社交平台涌现出大量以 MBTI 人格类型命名的群组;年轻人在交友、相亲时都会在自我介绍中加入 MBTI 代码 [4]。清华大学五道口金融学院的一篇科普文章指出,伊莎贝尔·布里格斯·迈尔斯深谙传播学和营销学,她在 1962 年出版了《请理解我:人格类型手册》,详细阐述了 MBTI 的理论体系和应用方法,此后 MBTI 逐渐在职业发展、团队建设、教育等领域得到广泛应用 [5]

但传播成功不等于测量科学。中国科学院心理研究所教授陈祉妍在接受科技日报采访时表示:"任何测试都是有局限性的。MBTI 测试可以帮我们更好地了解人的性格特征,但不能仅以单一的测试结果,就推断一个人的心理特征。要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析,这样才可能得出一个比较可靠、客观的结果。"[4]

这段话的分量在于,它来自一位专业心理学研究者的公开表态,而非网络上的泛泛质疑。它指向一个关键问题:MBTI 作为自我报告式工具,其信效度本身就存在争议,那么基于 MBTI 框架的机器分类,是否只是在为一个本就不够稳固的体系叠加一层技术光环?

测量学上的争议并非空穴来风。McCrae 与 Costa 在 1989 年发表于《Journal of Personality》的经典论文中,从大五人格模型的视角重新解释了 MBTI,发现 MBTI 的四个维度在很大程度上可以被大五人格的维度所覆盖,而非独立于其外 [13]。这意味着 MBTI 的类型划分可能并没有捕捉到它声称捕捉的独特结构。与此同时,中文语境下的效度问题也早有研究:苗丹民等人对 MBTI 中文版(MBTI-G)的效度分析显示,量表在中国样本中的表现需要谨慎解读 [20]。相比之下,即便是相对成熟的大五人格测验,在中国应用中的信度概化分析也发现,过去 20 年国内相关文献中约 68.15% 存在"信度引入"现象 [36]——如果连大五人格的国内应用都存在信度报告不规范的问题,九型人格和 MBTI 的测量学基础只会更薄弱。

三、机器分类的效度从哪里来,又会在哪里断裂

从技术角度看,用语言特征和表情符号做人格分类,面临几个绕不开的难题。

第一个难题是跨源泛化。凤淑芬的研究特别强调了"跨源性格侦测"这一场景,并发现表情符号和语言特征在此场景下比词袋模型更稳定 [1]。所谓跨源,意味着训练数据来自一个平台,而应用场景在另一个平台。不同平台的表达规范、表情使用习惯、甚至输入法默认表情集都不同。这种语境迁移会直接削弱模型的判断力。

第二个难题是人格理论本身的效度传导。如果九型人格或 MBTI 的类型划分本身缺乏足够的心理测量学证据,那么机器分类的"准确率"就只是在拟合一个可能并不存在的真实结构。前文提到的信度概化数据已经提示,即便是相对成熟的大五人格测验,在国内应用中也存在信度报告不规范的问题 [36]。那么九型人格和 MBTI 的测量学基础,只会更薄弱。

第三个难题是标签的自我实现。MBTI 在社交网络上的流行,已经使其从测评工具变成了一种身份标签。当一个人自称"I 人"或"E 人"时,这个标签可能反过来塑造他的行为——他可能因为认同"I 人"身份而更少参与社交,也可能因为想证明自己是"E 人"而刻意表现外向。华东师范大学心理咨询中心的一篇科普文章把这类现象归纳为三重质疑:社会期望偏差(被测者会按企业偏好作答)、巴纳姆效应(笼统描述让人"对号入座")、以及信效度存疑 [28]。昆士兰大学心理学教授亚历山大·哈斯拉姆也曾提醒,过度使用人格标签可能限制社交圈、并让人放弃改变性格的可能性 [21]。这种标签内化效应,会污染任何基于行为痕迹的人格推断。

四、职场测评的边界正在被技术重划

把视线拉回职场。MBTI 在企业管理中的应用由来已久。长庚大学的一项硕士研究指出,MBTI 人格类型在企业针对新进人员或员工当作适性测验已久 [34]。该研究以国军通资电单位人员为对象,回收 351 份有效问卷,发现该群体中 ISFJ 型占比最高,达 31.63%,次之为 ISTJ 型,占 20.51% [34]。研究者关注的核心问题是:人格类型是否与组织认同度和离职倾向存在关联,进而能否用于降低流动率、实现"适才适所" [34]

这项研究的价值在于它展示了一种典型的职场测评逻辑:用 MBTI 把人分类,再观察不同类别在组织行为上的差异。但它的局限也同样明显——351 份问卷来自一个特定职业群体,结论能否外推到互联网公司、制造业或创意行业,是存疑的。

更值得警惕的是,当机器分类技术成熟后,职场测评可能不再需要员工"配合"。一个值得推演的场景是:企业内部的即时通讯工具、邮件系统、甚至代码提交记录,都在持续产生语言数据。如果这些数据被用于实时推断员工的人格类型,并据此分配任务、评估晋升潜力,会发生什么?

这不是纯粹的假设。凤淑芬的研究已经表明,用语言特征和表情符号做九型人格分类在技术上是可行的 [1]。而从人力资源与组织发展的视角看,技术可行性从来不是唯一的决策依据。测评工具的使用必须回答三个问题:测什么、准不准、该不该。

"测什么"涉及构念效度。如果企业用 MBTI 类型来预测离职倾向,那么前提是 MBTI 类型与离职行为之间存在稳定的因果关系。但现有研究更多是相关性分析,且样本有限 [34]。《心理科学进展》曾专门梳理过"人员选拔中人格问卷可用性之争",指出以往研究对工作绩效内涵及参照效标的界定、问题设计的逻辑基础等存在各自局限,学界对个性问卷的有效性一直存在分歧 [46]。SHRM 在关于如何挑选招聘测评工具的实务报告中也强调,心理能力测试才是"工作绩效的单一最佳预测指标",人格测评的定位应更谨慎 [51]。"准不准"涉及测量精度。自我报告式问卷至少有统一的施测条件,而语言痕迹分析则受平台、语境、时间跨度等多重因素干扰。"该不该"涉及伦理与法律。在员工不知情的情况下,用其聊天记录推断人格类型,在多数司法管辖区都可能触及隐私保护红线。

现实中的滥用苗头已经出现。《法治日报》调查发现,有"95 后"求职者每次投简历前都强迫自己做一次 MBTI 测试,只有测出"完美人格"才放心投递;一些互联网招聘平台上,MBTI 正在被部分企业当成筛选的隐性门槛 [16]。界面新闻的深度报道进一步指出,MBTI 在职场招聘中可能成为不平等再生产的工具——当问卷本身把"指挥官人格"描述为"天生的领导者"、把其他类型描述为"胆小又敏感"时,测试结果就可能被用来为既有的筛选偏好背书 [10]。专业人士对此的共识是:心理测试结果可能仅反映测试者的短时状态,企业招聘时不宜将其作为决定因素,考察求职者是否适合岗位应多角度进行 [7]

五、一个务实的中间立场

那么,机器分类技术对职场测评究竟意味着什么?

从人才测评的专业角度看,一个可能的判断是:它不会取代传统测评,但会改变测评的生态位。传统问卷式测评的优势在于标准化和可解释性——你知道自己在测什么,也知道结果怎么来的。语言痕迹分析的优势在于非侵入性和连续性——它不需要员工专门抽出时间作答,可以在自然工作流中持续采集信号。

一个务实的做法是把两者结合:用自陈式测评建立基线,用语言痕迹分析做动态追踪,当两者出现显著偏离时,再启动人工评估。这样既保留了传统测评的效度优势,又利用了机器分类的实时性。高校职业发展中心的实践已经提供了参照:华东师范大学 MBA 教育中心提供的 Career Sky 职业测评系统,就把 MBTI 性格测评与霍兰德职业兴趣测评、能力测评、价值观测评并列使用,并配套职业库,强调引导参试者做自我职业规划,而非用单一结果下判断 [15]。美国德雷塞尔大学 Steinbright 职业发展中心同样把人格测评定位为"帮助学生理解自己、了解兴趣如何与职业目标对齐"的自助工具,并明确建议对结果有疑问时与职业顾问讨论 [22]。这些做法背后的共同逻辑是:测评是对话的起点,不是结论。

但这一切的前提是透明和知情同意。员工有权知道哪些数据被采集、用于什么目的、结果如何影响他们的职业发展。没有这个前提,再精准的机器分类也只是在制造一个更隐蔽的操控系统。

回到九型人格的初衷。国立台湾师范大学的一项研究访谈了九位受过完整九型人格培训的受训者,发现经过培训后,不同型号的人皆能对自我有更多的认识 [2]。这项研究的价值不在于验证九型人格的分类准确性,而在于揭示了一个更根本的命题:人格测评的意义,首先在于帮助个体深入探索自己行为背后的欲望与核心恐惧 [2]

如果机器分类技术最终服务于这个目的——帮助人更理解自己,而非被更高效地分类和处置——那它才配得上"测评"二字。否则,它只是把职场中本就存在的信息不对称,推向了一个更精密的层级。

六、结语:技术能力与伦理判断之间

从九型人格到 MBTI,从问卷到语言痕迹,人格测评的演化轨迹清晰可见:更少的主动配合、更多的被动数据、更实时的反馈、更隐蔽的判断。凤淑芬的研究提示了技术上的可能性 [1],长庚大学的研究展示了应用上的尝试 [34],而陈祉妍教授的提醒则划出了专业的边界 [4]

作为横跨心理学与人力资源领域的实践者,一种值得考虑的立场是把机器分类看作一面镜子——它照出的不是人格的真相,而是我们愿意用多少隐私去换取多少便利。职场测评的未来,不取决于算法能多准确地从表情符号里读出你是几号人格,而取决于组织是否愿意在效率与尊重之间,选择一个让双方都能接受的平衡点。

这个选择,技术本身回答不了。