性格測評放進招聘流程:從人格分類研究看選才機制的科學邊界
摘要:性格測評正從自我探索工具變成招聘篩選門檻。本文從人格分類研究的技術現實出發,結合測評工具的預測效度證據,探討企業將性格測評納入選才機制時,科學能支撐到哪裡、又該在哪裡止步。
一、一個正在發生的轉變:從「認識自己」到「被別人用來判斷你」
性格測評在職場招聘中的存在感,這幾年明顯上升。MBTI、卡特尔16PF、PDP、九型人格等工具頻頻出現在面試環節,部分企業甚至在崗位調整和晉升時也會參考,還有企業提出性格測試不通過一年內不能再投簡歷的規定 [5]。求職者的反饋也印證了這種感受:三輪面試都過了,最後卡在性格測試;剛做完測試就被通知與意向崗位不符 [5]。
這個轉變的關鍵在於測評的使用場景變了。過去,人格測驗主要服務於輔導與自我探索——比如賴氏人格測驗用來了解內外向、社會適應與情緒穩定,基本人格量表從個人適應、社會適應與情緒困擾三個組型切入,艾德華個人偏好量表了解人格偏好 [3];高校心理中心也強調,這些測驗經過科學化程序編製,目的是協助學生評估優劣、促進成長,而非給人下判斷 [4]。但當同一類工具被放進招聘流程,它的功能就從「幫你認識自己」變成了「幫企業篩掉你」。這個位移,是理解後續所有爭議的起點。
值得先釐清的是:測評工具本身沒有變,變的是決策類型。自我探索場景下,測評結果的解釋權在使用者手上,低信度或情境波動由本人自行校正;招聘篩選場景下,解釋權轉移到企業,一個帶有測量誤差的分數被直接轉換為淘汰/通過的二元決策,誤差不再有被修正的機會。這一結構性差異,決定了同一份測評在兩個場景中的合理使用方式截然不同。
二、人格分類研究告訴我們的事:標籤沒那麼穩
要判斷性格測評能不能當招聘門檻,得先看人格分類本身在技術上能做到什麼程度。近年的研究提供了一些相當誠實的線索。
以 MBTI 為例,一項以 Kaggle MBTI Personality Type Dataset 為基礎的碩士研究指出,這類資料集的文本多來自人格討論社群,貼文中可能直接出現 MBTI 類型、人格維度縮寫或認知功能詞彙;如果不處理,模型可能依賴這些顯性標籤線索進行分類,造成標籤洩漏並高估模型效能 [1]。換句話說,連學術研究都要費力排除「答案寫在題面上」的干擾,才能得到可信的分類結果。該研究改用使用者為單位的階層式 Transformer 模型,先以 BERT 編碼單篇貼文,再整合同一使用者的多篇貼文 [1]。
另一項針對九型人格的研究,則比較了詞袋特徵與表情符號、語言特徵(LIWC、詞性標籤)在跨來源人格偵測中的表現,結果顯示後者更穩定、更泛化,邏輯回歸在所有特徵與所有性格類型上都能運作 [2]。這聽起來是好消息,但要注意它的邊界:研究目的是「自動性格偵測」與理解各類型用戶的在線互動行為 [2],而不是預測一個人能不能勝任某個崗位。從「文字能反映人格傾向」到「人格傾向能決定工作表現」,中間隔著好幾層未被驗證的推論。
這裡的機制值得拆開來看。人格測驗在招聘中的推論鏈條實際上是三段:第一段是「作答反應能否穩定反映個體特質」,涉及信度與社會讚許性偏差;第二段是「特質分數能否推論到職場行為」,涉及構念效度;第三段是「職場行為能否預測特定崗位的績效」,涉及效標關聯效度。上述兩項研究只觸及第一段的部分環節,第二、三段則完全不在其研究設計範圍內。企業若直接拿第一段的技術結論去支撐第三段的篩選決策,等於跳過了兩層尚未驗證的推論。
三、預測效度的證據:哪些測評真的能預測績效
如果說人格分類研究回答的是「測得準不準」,那招聘場景真正要問的是另一個問題:它能不能預測工作表現?這方面,專業人力資源機構的立場相對明確。
SHRM 專家 Whitney Martin 在 2018 年人才大會上提出招聘測評的「四個 V」原則,並指出心理能力測驗是工作績效「單一最佳預測指標」[13]。同一份報告引用 Talent Board 2016 年北美候選人體驗研究指出,82% 的企業已在使用某種形式的職前測評 [13]。這組數據放在一起看很有意思:測評的使用率很高,但被專家點名為最佳預測指標的,是心理能力測驗,而非企業最熱衷的性格測驗類型。
心理能力測驗之所以在預測效度上居於前列,機制上與其測量對象有關。認知能力測驗捕捉的是個體處理資訊、推理與解決問題的一般能力,這類能力直接參與幾乎所有崗位的核心任務執行,因此與績效的關聯路徑較短、較直接。人格測驗測量的則是行為傾向與偏好,它對績效的影響需要經過「情境觸發—行為選擇—任務完成」等多個中介環節,每一環節都會引入干擾變項,效應因此在統計上被稀釋。這也是為什麼在人事選拔的效度研究中,人格測驗的效標關聯效度通常低於認知能力測驗,且高度依賴職種與效標的匹配程度。
企業內部的實證研究則呈現更複雜的圖景。一項以某運輸服務業 T 公司為對象的研究,使用該公司 2098 名同時具備人格測驗與工作績效資料的員工、1468 名同時具備人格測驗與工作滿意資料的員工進行分析,發現人格特質中僅「人際效能」與「重複性」對工作績效有顯著負向影響,「精確遵從」則有顯著正向影響;對工作滿意而言,「精確遵從」與「重複性」有顯著正向影響,「獨處自為」則為負向 [11]。該研究還發現,人格測驗篩選機制會篩出「精確遵從」特質較高的員工,使工作績效提高;對工作滿意而言,篩選機制會篩出「精確遵從」及「重複性」特質較高的員工,先使工作滿意提高,但可能因新進人員組織適應期的調整,反而造成篩選後員工工作滿意降低 [11]。
這項研究的價值在於它示範了「有效」長什麼樣:不是「性格測試通過與否」,而是特定人格特質與特定職組、特定績效指標之間的關聯,而且關聯方向未必符合直覺——某些特質對績效是負向的,對滿意卻是正向的。這種細粒度,是「性格測試當硬杠杠」的做法完全丟失的。更關鍵的是,同一組特質在不同效標(績效 vs. 滿意)上呈現相反方向,說明「好性格」本身不是一個有意義的篩選標準;脫離具體職組與具體效標談性格門檻,在方法論上無法成立。
四、當測評被當成門檻:三個被忽略的科學邊界
從人才測評的專業視角看,把性格測評當作招聘門檻,至少踩到了三條邊界。
第一條是狀態與特質的混淆。 專業人士指出,心理測試結果可能僅反映測試者短時狀態,企業招聘時不宜將其作為決定因素 [5]。一個人在求職焦慮期、睡眠不足或對題目理解偏差的情況下做出的作答,與其穩定的人格特質之間有多大距離,是測評解釋時必須交代的前提。把短時狀態當成長期特質來篩人,等於用一張快照否定一整個人。
第二條是工具目的與使用目的的錯配。 高校心理中心使用的測驗,無論是人格特質、情緒與生活適應還是生涯探索類,其設計目的都是協助自我了解與成長規劃 [4]。九型人格的企業應用研究也顯示,其價值在於讓領導者透過理解自我本型與不同性格差異,以更多同理心與團隊互動 [10]。這些都是「發展性」用途。一旦同一工具被用於「淘汰性」決策,它原本的解釋框架——強調自我探索、非評判——就被抽掉了,剩下的只是一個被誤用的分數。
第三條是篩選機制與組織結果的脫節。 前述 T 公司研究已顯示,篩選會改變員工組成特質,進而影響績效與滿意,且兩者方向可能不一致 [11]。企業若只盯著「招進來的人性格對不對」,卻不追蹤這套篩選機制長期對團隊多樣性、協作模式與留任率的影響,就是在用一個未經組織層面驗證的工具做高風險決策。
五、那該怎麼用:把測評放回它該在的位置
以人力資源與組織發展的視角看,性格測評不是不能用,而是要分清它在選才鏈條裡的位置。
SHRM 的建議提供了一個可操作的參照:心理能力測驗的預測效度最高 [13]。這意味著,如果企業真的想用測評提升選才效率,優先級應該放在認知能力類工具上,而不是把性格測驗推到決策前線。
對於性格測評本身,更合理的位置有三個。其一,作為發展工具——入職後用於自我認識、團隊溝通與領導力發展,這與九型人格研究揭示的「透過理解本型探索行為背後的欲望與核心恐懼」的用途一致 [10]。其二,作為結構化面試的補充資訊——用於追問與澄清,而非直接淘汰。其三,作為組織層面的研究工具——像 T 公司那樣,長期追蹤人格特質與績效、滿意的關聯,用數據決定哪些特質在哪些職組真的重要 [11],而不是套用通用標籤。
需要說明的是,上述三種用法並非等價的建議,其證據基礎也不同。發展性用途的證據主要來自工具設計初衷與應用研究 [10],屬於目的匹配層面的合理性論證;作為結構化面試補充資訊的建議,則建立在結構化面試本身具備較高預測效度的專業共識之上 [13],性格測評在此僅承擔追問線索的功能,不獨立承擔決策權重;組織層面研究工具的建議,則直接對應 T 公司研究的做法 [11],其證據等級來自企業內部效度驗證。三者共同的前提是:性格測評的解釋必須與具體目的、具體職組、具體效標綁定,脫離這些條件的通用門檻在方法論上不成立。
六、結語:科學能支撐的,比企業想要的少
性格測評進入招聘流程,本質上是一個科學工具被賦予了超出其證據基礎的決策權重。人格分類研究告訴我們,即便是嚴謹的學術模型,也要費力排除標籤洩漏才能得到可信結果 [1];測評工具的跨情境穩定性需要特定語言特徵與方法論支撐 [2];而招聘測評領域的專業共識是,心理能力測驗是工作績效的單一最佳預測指標 [13]。企業內部研究則顯示,人格特質與績效、滿意的關聯是細粒度、有方向性、甚至相互衝突的 [11]。
這些證據加起來,指向的結論不是「性格測評沒用」,而是「它被用錯了地方」。把它當門檻,是用一個反映短時狀態 [5]、設計目的為自我探索 [4] 的工具,去做一件它本來就不擅長的事。基於上述證據,更合理的選才機制是將測評放回輔助與發展的位置,把決策權重留給結構化面試、認知能力評估與實際工作樣本——這不是對測評的否定,而是對它的尊重。
(本文之事實性陳述均標註來源編號,對應頁面自動生成的參考資料區。)