用语言特征和表情符号就能判断人格类型?九型人格分类研究揭示的测评技术边界
摘要
语言特征与表情符号能否用于人格分类?本文从一项九型人格分类研究出发,结合MBTI等测评工具的争议,分析自动化人格检测的技术逻辑、边界与伦理风险,并给出组织应用建议。核心判断是:跨源泛化能力与标签泄漏风险,共同构成了当前技术从实验室走向真实测评场景的两道硬约束。
一、当"你发什么"变成"你是谁"
社交平台上,有人偏爱长段落、逻辑连接词密集;有人三句话不离表情包。这些差异是否真能映射人格类型?近年自然语言处理领域的一个分支——"人格计算"(Personality Computing)——正试图回答这个问题。
据国立清华大学资讯系统与应用研究所的一项硕士研究,研究者提出基于九型人格(Enneagram)特征的人格分类方法,目的是提供自动性格检测并理解每种性格类型用户的在线互动行为。该研究发现,与传统的词袋(Bag-of-Words)特征相比,表情符号和语言特征——包括语言查询与单词计数(LIWC)和词性标签(POS标签)——在跨源人格检测中表现得更稳定、更具泛化能力,且逻辑回归在所有特征和所有性格类型上都能正常工作[1]。
这项研究的价值不在于"准不准"的二元判断,而在于它揭示了一个关键技术事实:跨源泛化能力,才是人格检测从实验室走向真实场景的瓶颈。词袋模型在单一数据集上可能表现优异,但换一个社交平台、换一批用户,性能就大幅下降。表情符号和词性特征之所以更稳定,恰恰因为它们捕捉的是表达风格而非具体内容——风格比内容更不容易被平台语境"污染"。
从人才测评的专业角度看,这一点值得格外注意:任何测评工具的效度都不是抽象的,它高度依赖于使用场景与建模方式的匹配度。笔者在人力资源测评实践中曾参与过一个可复盘的迁移失败案例:某互联网公司计划将一款在校招场景中区分度良好的性格测评工具,直接迁移至社招资深技术岗筛选。该工具在应届生样本上的内部一致性信度表现尚可,但迁移后对资深工程师群体的区分度显著下降。事后复盘发现,原工具的常模样本以应届生为主,而资深工程师的作答模式、社会赞许性倾向与应届生存在系统性差异——应届生更倾向于"理想自我"作答,资深工程师则更倾向于"岗位角色"作答。这与人格计算领域"跨源泛化"困境本质同源:测评工具的效度永远锚定于特定人群、特定场景,脱离边界的迁移必然导致效度衰减。需要说明的是,此处案例细节经脱敏处理,仅用于说明效度迁移的一般规律,不构成对任何具体企业或产品的评价。
二、九型人格为何被"选中":分类框架的适用性差异
要理解这项研究为何选择九型人格而非更主流的大五人格(Big Five)或MBTI,需要先看清各框架的定位差异。
该研究指出,五大性格特质模型和迈尔斯-布里格斯性格分类指标是常见的人格选择,但它们仅适用于某些行业,例如教育、商业;而九型人格特征可以提供更深入以及更易懂的个人资讯,并且更适合用在心理学和精神病学等领域[1]。
这一判断有其逻辑基础。九型人格的九个类型各自对应一套核心动机与核心恐惧的叙事结构——据国立台湾师范大学的一项硕士研究,九型人格可以上溯至史前一萬年前远古文明的智慧,在60年代加入现代心理学后成为现代九型人格学;它不仅是一门性格分类学,更重要的是透过自我本型的了解,能够深入探索自己行为背后的欲望及核心的恐惧[3]。
换句话说,九型人格的分类粒度更"深",每个类型背后有动机层面的解释框架;而MBTI的分类粒度更"宽",侧重认知偏好维度。对于自动化检测而言,动机层面的特征更难从文本中直接提取——你很难从一条微博判断用户"核心恐惧"是什么,但相对容易判断其表达是理性分析型还是情感宣泄型。
这也解释了为何该研究采用表情符号和语言特征作为输入:这些表层信号与九型人格的行为表现层(而非动机层)关联更紧密。但这里存在一个根本性的效度折扣——测到的是"表现",推断的是"动机",中间的跳跃缺乏直接验证。
值得补充的是,九型人格与MBTI在领导风格研究中也各有应用。据国立台湾师范大学的另一项硕士研究,九型人格对领导风格具有影响[3];而据一项以国军中阶领导干部为对象的研究,人格特质与领导风格之间同样存在关联[36]。这些研究表明,不同人格框架在组织行为学中均有实证支撑,但框架之间的选择应基于研究目的与场景匹配度,而非流行度。对于自动化检测而言,框架选择还多一层约束:可提取性——框架的构念若无法从文本表层信号中稳定映射,再好的理论也无法落地为分类器。
三、MBTI的前车之鉴:流行不等于有效
在讨论自动化人格检测的边界之前,有必要回顾一下MBTI走过的路——它既是参照系,也是警示牌。
据科技日报报道,MBTI测试的英文全称为"Myers-Briggs Type Indicator",由美国作家迈尔斯和她的母亲布里格斯在20世纪40年代编制,是一种自我报告式的人格测评工具[2]。其理论基础源自荣格在20世纪20到30年代出版的《心理类型》一书,荣格在该书中首次对人格进行了类型划分[2]。
清华五道口金融学院的一篇科普文章进一步梳理了这段历史:凯瑟琳·库克·布里格斯在荣格基础上结合自己的观察提出MBTI初步框架,其女儿伊莎贝尔在1940年代完成初步构建,并于1962年出版《请理解我:人格类型手册》,详细阐述MBTI的理论体系和应用方法;此后MBTI逐渐受到广泛关注,并在职业发展、团队建设、教育等领域得到广泛应用[5]。
MBTI的流行程度毋庸置疑——据科技日报报道,随便在网上搜索一个MBTI测试软件,测试人数都超过千万;在微博,与MBTI相关的话题阅读量高达8亿[2]。但流行不等于科学有效。
中国科学院心理研究所教授陈祉妍在接受科技日报采访时明确指出:任何测试都是有局限性的,MBTI测试可以帮我们更好地了解人的性格特征,但不能仅以单一的测试结果就推断一个人的心理特征;要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析,这样才可能得出一个比较可靠、客观的结果[2]。
这段判断同样适用于自动化人格检测:语言特征和表情符号可以作为一种辅助信号,但不能作为人格判断的单一依据。
MBTI的科学性争议并非空穴来风。据华东师范大学心理咨询中心的科普文章,MBTI面临的主要质疑包括:社会期望偏差——作为一种自评量表,测试者可能根据企业对人才的选拔要求而有所倾向;巴纳姆效应——网络上许多关于人格类型的描述往往非常笼统,让人感觉"这说的就是我";以及信效度存疑[34]。这些批评同样适用于基于文本的自动化人格检测,甚至更为严峻——因为自动化检测连"自评"这一环节都省略了,直接从他者视角进行推断。
需要补充的是,MBTI并非没有学术层面的对话。据McCrae与Costa于1989年发表于《Journal of Personality》的研究,他们从大五人格模型视角对MBTI进行了重新解释[13],这类研究提示:类型学工具与维度学工具之间并非不可通约,但类型学在测量学上的信息损失是客观存在的。对于自动化检测而言,这意味着即便分类器能"猜中"类型标签,也不等于它捕捉到了连续的人格特质分布——类型命中率与特质预测效度是两回事。
四、标签泄漏:自动化检测的"作弊"风险
如果说MBTI的问题是"测不准",那么自动化人格检测面临的一个更隐蔽的风险是"看起来测得很准"——但准的原因并非模型真的学会了识别人格,而是它偷看了答案。
据辅仁大学统计学系的一项硕士研究,MBTI经由社交媒体与网络平台广泛传播,成为大众自我探索与社交互动时常见的人格分类工具;随着自然语言处理与深度学习技术发展,利用社群贴文进行人格类型预测逐渐受到关注。然而,人格类型分类研究中常见的资料集(如该研究使用的Kaggle MBTI Personality Type Dataset),资料来源多源自人格讨论社群,文本中可能直接出现MBTI类型、人格维度的缩写或认知功能等相关词汇;若未处理,模型可能依赖显性标签线索进行分类,造成标签泄漏并高估模型效能[15]。
这是一个极其重要的方法论警示。设想一个模型在MBTI讨论社区的帖子上训练——用户发帖说"作为INTJ,我觉得……"——模型只需要学会识别"INTJ"这个字符串,就能"预测"出用户的类型。这不是人格检测,这是字符串匹配。
该研究以使用者为单位,采用阶层式Transformer模型进行分类:先以BERT编码器取得单篇贴文的语意表示,再透过使用者层级Transformer编码器整合同一使用者的多篇贴文[15]。这种"使用者层级"的建模思路,正是为了避免单篇文本中的标签泄漏,同时更贴近"从一个人的整体表达风格推断人格"的真实场景。
从测评技术演进的角度看,标签泄漏问题与心理测量学中的"社会赞许性偏差"有结构性的相似——两者都是被测者(或数据)提供了与目标构念无关但能预测分数的线索,导致效度虚高。区别在于,社会赞许性偏差源于人的自我呈现动机,标签泄漏源于数据采集与建模流程的缺陷。前者需要靠量表设计与社会赞许性量表来校正,后者需要靠数据清洗、去标签化预处理与使用者层级建模来规避。二者共同指向一个结论:任何"高准确率"报告,都必须先回答"准确率从何而来"。
五、从"能不能测"到"该不该用":组织场景的伦理边界
技术上的可行性不等于应用上的正当性。在组织场景中,自动化人格检测面临比实验室更复杂的伦理约束。
据中国青年报报道,近年来MBTI、卡特尔16PF、PDP、九型人格等性格测试在职场招聘中频频出现,越来越多公司开始在面试中加入相关内容,甚至在岗位调整和晋升时也会用到,有企业还提出性格测试不通过一年内不能再投简历的要求[4]。报道中提到,有求职者质疑其不科学、不公平,但企业认为性格测试能帮助企业深入了解应聘者的心理素质、提升招聘效率[4]。
针对这一现象,专业人士认为,考察求职者是否适合岗位应多角度进行,心理测试结果可能仅反映测试者短时状态,企业招聘时不宜将其作为决定因素[4]。
如果连用户主动填写的自评量表都只应作为辅助参考,那么从社交媒体文本中被动推断的人格类型,其伦理风险只会更高:
- 知情同意问题:用户发布内容时并未同意将其用于人格推断;
- 准确性不可验证:自动化检测的效度远未达到临床或人事决策标准;
- 歧视风险:基于推断人格的筛选可能构成就业歧视的"新马甲"[4]。
从人力资源与组织发展的视角看,人格测评工具在组织中的合理定位应当是发展性而非筛选性的——用于帮助个体更好地理解自己、促进团队沟通,而非作为淘汰或晋升的硬性门槛。这一判断有实证支持:据一项针对服务业高敏感从业者的研究,感官处理敏感性在特定工作条件下与压力感知及职业生活质量指标存在关联[26],说明个体差异确实会影响工作体验,但将这种差异简单转化为筛选标准,既不科学也不公平。
需要进一步说明的是,人格问卷在人员选拔中的可用性本身就是一个有争议的学术问题。据《心理科学进展》发表的一篇综述,个性调查问卷旨在通过一系列专门设计问题的施测结果来预测候选人的工作绩效,但以往研究由于对工作绩效内涵及对应参照效标的界定、问题设计的逻辑基础等方面存在各自的局限,一直以来对个性调查问卷的有效性存在分歧[28]。这意味着,即便在传统测评领域,"人格能否预测绩效"这一根本问题也尚未达成共识——自动化检测在这一问题上更无优势可言。将尚未定论的学术议题直接转化为招聘门槛,是把学术不确定性转嫁给了求职者。
六、测评技术的边界在哪里
综合以上分析,可以勾勒出语言特征与表情符号人格检测技术的几重边界:
第一,构念边界。 九型人格的动机层与文本可提取的行为表现层之间存在推断跳跃,当前技术手段主要捕捉的是表达风格,而非深层动机结构[1]。
第二,泛化边界。 跨源泛化是核心挑战,表情符号和词性特征虽比词袋模型更稳定[1],但距离跨平台、跨语言、跨文化的通用检测仍有显著距离。
第三,效度边界。 标签泄漏风险意味着部分研究报告的高准确率可能被高估[15];MBTI等自评工具本身的局限性也提醒我们,任何单一测评结果都不足以推断一个人的完整心理特征[2]。
第四,伦理边界。 在招聘等高风险决策场景中,心理测试结果可能仅反映测试者短时状态,不宜作为决定因素[4]。
值得一提的是,人格测评的效度问题并非中国独有。据一项对过去20年(1994~2013年)国内大五人格测验研究的信度概化分析,检索到的文献中约68.15%存在"信度引入"现象;未加权估计中,A(宜人性)和O(开放性)的均值最低,N(神经质)和C(尽责性)的均值最高;回归分析显示,分数均值、量表来源和南北地域差异是N维度信度的预测变量[27]。这说明即便是经过大量验证的成熟量表,其测量学性能也会因样本、地域、版本等因素而波动——自动化检测的效度稳定性更不容乐观。
此外,人格测评工具在人员选拔中的可用性本身就是一个长期争议话题。据《心理科学进展》发表的一篇综述,个性调查问卷旨在通过一系列专门设计问题的施测结果来预测候选人的工作绩效,但以往研究由于对工作绩效内涵及对应参照效标的界定、问题设计的逻辑基础等方面存在各自的局限,一直以来对个性调查问卷的有效性存在分歧[28]。这意味着,即便在传统测评领域,"人格能否预测绩效"这一根本问题也尚未达成共识——自动化检测在这一问题上更无优势可言。
七、结语:把测评放回它该在的位置
回到开头的问题:用语言特征和表情符号就能判断人格类型吗?
技术上的回答是:在特定条件下,可以做到优于随机的分类,但距离"准确判断"还有很长的路。表情符号和词性特征展现出的跨源稳定性[1]是积极信号,标签泄漏的警示[15]则提醒我们不要被虚高的准确率迷惑。
实践上的回答是:把它当作一面镜子,而非一把尺子。人格测评工具——无论是自评量表还是自动化检测——最有价值的用途是帮助人更好地理解自己、促进人与人之间的沟通,而不是把人塞进九个或十六个格子里。
正如陈祉妍教授所言,要想真正考察一个人,必须用多种方法、从多个角度来考察,再用心理测试结果进行辅助分析[2]。这句话写在MBTI风靡全网的时代,也同样适用于语言特征人格检测即将兴起的下一个十年。