コンサルティング心理学大全Consulting Psychology Compendium
記事アセスメント・組織診断エビデンス:強い根拠

採用アセスメントの妥当性:2022年に何が変わったか

採用選抜の「何がいちばん当たるのか」は2022年に書き換わりました。Sackett et al. (2022) により構造化面接 r≈.42 が最強となり、一般的認知能力 r≈.31 は首位から陥落した経緯と実務への意味を解説します。

公開 2026-08-25 / 更新 2026-08-25

結論

採用選抜の妥当性の「定説」は、2022年に大きく書き換わりました。長く引かれてきた Schmidt & Hunter (1998) の推定値は、範囲制限への系統的な過剰補正が指摘され、Sackett, Zhang, Berry, & Lievens (2022) によって下方修正されています。順位も入れ替わり、構造化面接(r ≈ .42)が最も高い妥当性を示し、一般的認知能力(r ≈ .31)は首位から陥落しました。実務上の含意はシンプルで、「テストを増やす」より「面接を構造化する」ほうが費用対効果が高い、ということです。

このページの要点

  • Schmidt & Hunter (1998) の高い妥当性推定は、範囲制限への過剰補正によるものだったと指摘され、2022年に下方修正された
  • 現在の最良推定では、構造化面接 r ≈ .42 が最強で、職務知識テスト .40、バイオデータ .38、ワークサンプル .33、一般的認知能力 .31 と続く
  • 「認知能力テストが最強」という前提で設計された選抜システムは、見直しの余地がある
  • 妥当性は「当たり具合」、信頼性は「測り方の安定性」。範囲制限は「合格者しか追跡できない」ことで生じる見かけ上の弱い相関
  • 日本企業では、応募者の受容性と説明責任を含めて設計する必要がある

採用アセスメントの「妥当性」とは何か

妥当性(validity)とは、その選抜手法が「入社後の活躍をどれくらい言い当てられるか」の度合いです。ふつうは相関係数 r で表され、0 に近いほど当たらず、1 に近いほど当たる、という読み方をします。

採用の世界では長いあいだ、Schmidt & Hunter (1998) が示した推定値が「定説」として扱われてきました。そこでは一般的認知能力テスト(いわゆる知能・地頭のテスト)が最も高い妥当性を持つとされ、多くの選抜システムがその前提で設計されてきました。

しかし2022年、この前提そのものに疑問符がつきました。

2022年に何が変わったのか

Sackett, Zhang, Berry, & Lievens (2022, Journal of Applied Psychology) は、従来のメタ分析が範囲制限(range restriction)への系統的な過剰補正を行っていたと指摘しました。統計的な補正のかけすぎによって、妥当性の推定値が実態より高く出ていた、という指摘です。

補正の方法を見直した結果、妥当性は軒並み下方修正され、さらに順位そのものが入れ替わりました

選抜手法Sackett et al. (2022) の推定値
構造化面接r ≈ .42(最も高い)
職務知識テストr ≈ .40
経験的キー方式バイオデータr ≈ .38
ワークサンプル(実務課題)r ≈ .33
一般的認知能力r ≈ .31(首位から陥落)

最も重要なのは、構造化面接が一般的認知能力を上回ったという一点です。「テストのほうが面接より客観的で当たる」という、長く語られてきた説明は、現在の最良推定とは合いません。

引用のしかたに注意

Schmidt & Hunter (1998) の数値を単独で引くと、現在では過大とされる推定値を流通させることになります。研修資料や社内提案書で選抜手法の妥当性に触れるときは、必ず Sackett et al. (2022) による下方修正を併記してください。

「妥当性」「信頼性」「範囲制限」をやさしく整理する

専門用語が3つ続くので、いったん平易に整理します。

信頼性(reliability) は「測り方が安定しているか」です。同じ人を2回測って結果が大きくぶれるなら、その道具は信頼性が低い。体重計が乗るたびに5キロ違う値を出すようなものです。

妥当性(validity) は「測りたいものを測れているか」「知りたい将来を言い当てられるか」です。体重計が毎回そっくり同じ値を出しても、それで走る速さを予測することはできません。信頼性が高くても妥当性が高いとは限らない、という関係です。

範囲制限(range restriction) は、採用研究に固有の厄介な問題です。入社後の業績を追跡できるのは、合格した人だけです。不合格になった人が入社していたらどうだったかは、誰にもわかりません。合格者は最初から得点が高い側に偏っているので、その集団の中だけで「テスト得点と業績の相関」を計算すると、実際より弱く見えます。

そこで研究者は統計的にこの偏りを補正します。従来の推定は、この補正をかけすぎていたというのが2022年の指摘です。もともと補正は必要なのですが、必要以上に持ち上げていた、ということになります。

主要な手法をどう位置づけるか

構造化面接は、質問内容・順序・評価基準・評価者の訓練があらかじめ決められた面接です。現在の最良推定で最も高い妥当性を示しました。しかもツールの購入費用がかからず、応募者の納得も得やすい。費用対効果の観点では、最初に着手すべき手法だと考えられます。

職務知識テストは、その仕事に必要な知識を直接問うものです。r ≈ .40 と高い一方、未経験者の採用には使いにくいという制約があります。

ワークサンプルは、実際の仕事に近い課題をやってもらう方法です。r ≈ .33。設計と採点にコストがかかりますが、応募者から見て「何を見られているか」が明快で、受容性が高い手法です。

アセスメントセンターは、グループ討議・面接シミュレーション・インバスケットなど複数の演習を組み合わせ、訓練されたアセッサーが行動を観察・評価する方法です。運用コストが大きいため、管理職登用など人数が限られる場面に向いています。

性格検査(ビッグファイブ) は、外向性・協調性・誠実性・情緒安定性・開放性という5因子で個人差をとらえる枠組みです。職務との関連を事前に定義したうえで補助情報として使う設計なら意味がありますが、単独で合否を決める道具としては妥当性が十分ではありません。

構造化面接をどう作るか

構造化面接は「買うもの」ではなく「作るもの」です。手順は次のようになります。

  1. 職務分析を行う。 その仕事で成果を分ける行動は何か。現に活躍している人と、そうでない人の違いはどこに出るのか。ここを言語化しないと、以降がすべてぼやけます。
  2. 質問を作る。 過去の行動を尋ねる行動記述質問(「〜したときのことを教えてください」)と、想定場面を尋ねる状況質問(「〜という状況なら、どうしますか」)が代表的です。
  3. 評価基準を先に書く。 「4点はこういう回答、2点はこういう回答」というレベル記述を、面接の前に文章にしておきます。
  4. 全員に同じ質問を同じ順で尋ねる。 会話の流れで質問を変えると、応募者間の比較ができなくなります。
  5. 面接官を訓練する。 同じ回答を複数の面接官に採点してもらい、ずれを合わせる練習をします。
  6. その場で採点する。 面接後にまとめて印象で振り返ると、直前の印象や好き嫌いが混ざりやすくなります。

日本企業で使うときの注意

日本の新卒採用では、職務が入社時点で確定していないことが多く、職務分析の起点を作りにくいという事情があります。この場合は「入社1〜3年目に共通して求められる行動」を単位に置くと、質問と基準を作りやすくなります。

応募者の受容性も無視できません。応募者から見て「何を測られているのか分からない」手法は、たとえ妥当性が高くても、企業イメージや辞退率に影響します。ワークサンプルや構造化面接は、この点で有利です。

説明責任も重要です。不合格の理由を細部まで開示する必要はありませんが、「どのような基準で、誰が、何を見て判断したか」を社内で説明できる状態にしておくことは、選抜の質を保つうえでも、後述するAIツール導入の判断基準としても効いてきます。

AIによる選抜ツールについては、Tippins, Oswald, & McPhail (2021) が妥当性エビデンスの不足と不透明性、訓練データの歴史的バイアスの再生産、ブラックボックス性、法的防御可能性、候補者のプライバシーと受容性という5つの懸念を整理しています。また Landers & Behrend (2023) は、公正性には主観的知覚・法と倫理・技術的定義という3つのレンズがあり、それらは一致しないと指摘しています。詳しくは AI×コンサルティング心理学 を参照してください。

注意点・限界

第一に、ここで示した数値は多数の研究を平均した推定値であり、あなたの会社の特定の職務でそのまま再現される保証はありません。自社での検証(採用時の評価と入社後の評価の関係を追う)に勝るものはありません。

第二に、r ≈ .42 という値は「4割強しか当たらない」とも読めます。単一の手法で採否を決めるのではなく、複数の情報を組み合わせて誤りの確率を下げる設計が現実的です。

第三に、選抜の妥当性が高いことと、入社後に活躍することは同じではありません。どれほど選抜を精緻にしても、配属・上司・仕事の設計が噛み合わなければ成果は出ません。採用の精度を上げる投資と、入社後の環境を整える投資は、別々に必要です。

今日からできる小さな一歩

次の面接の前に、その職務で成果を分けている行動を3つだけ書き出し、それぞれについて質問を1つ用意してください。 そして「よい回答」と「弱い回答」がどう違うかを、面接前に一文ずつ書いておきます。全員に同じ3つを同じ順で尋ねるだけで、あなたの面接はすでに構造化の入り口に立っています。ツールを買う前に、これを試してください。

よくある質問

Schmidt & Hunter (1998) はもう引用してはいけないのですか?

引用してはいけないわけではありません。ただし単独で引用すると、現在では過大とされる数値をそのまま流通させることになります。Sackett et al. (2022) による下方修正を必ず併記してください。歴史的な文献として参照し、最新の推定値で上書きするのが正確な扱いです。

構造化面接と、いわゆる「普通の面接」は何が違うのですか?

質問内容・順序・評価基準・評価者訓練があらかじめ決まっているかどうかです。同じ職務に応募した全員に同じ質問を同じ順で尋ね、あらかじめ言語化した基準で採点します。面接官が自由に会話を組み立てる形式は、この意味では構造化されていません。

相関係数 r = .42 は、実務的にはどのくらいの大きさですか?

完全な予測(r = 1.00)ではまったくありませんが、選抜手法としては最も高い水準です。ひとつの手法で採否が決まるのではなく、複数の情報を組み合わせて誤りの確率を下げる、と考えるのが実務的です。「当たる/当たらない」の二分法ではなく、確率を改善する道具として扱ってください。

性格検査は使う価値がありますか?

ビッグファイブ(外向性・協調性・誠実性・情緒安定性・開放性)などの枠組みは、職務との関連を事前に定義したうえで補助的に使う設計であれば意味があります。ただし単独の合否判定に使うには妥当性が十分ではなく、応募者による回答の歪みも起こりえます。詳しくは 採用に性格検査を使ってよいですか? を参照してください。

何から手をつければよいですか?

面接の構造化です。追加の外部ツールを買う前に、いま行っている面接の質問と評価基準を書き出して統一するほうが、費用対効果は高いと考えられます。

参考文献

  1. Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range. Journal of Applied Psychology, 107, 2040-2068.
  2. Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262-274.
  3. Sackett, P. R., et al. Revisiting the design of selection systems in light of new findings regarding the validity of widely used predictors. Industrial and Organizational Psychology.
  4. Tippins, N. T., Oswald, F. L., & McPhail, S. M. (2021). Scientific, legal, and ethical concerns about AI-based personnel selection tools. Personnel Assessment and Decisions, 7(2).
  5. Landers, R. N., & Behrend, T. S. (2023). Auditing the AI auditors: A framework for evaluating fairness and bias in high-stakes AI predictive models. American Psychologist, 78(1), 36-49.

本ページは上記の文献等をもとに編集部が作成しています。数値や結論の詳細は必ず原典をご確認ください。

ランダムに読む押すたびに変わります

目的がはっきりしていないときは、偶然にまかせてみてください。サイト内の443ページから3つ選んで表示します。

キーワードから探す

キーワードから探す押すたびに変わります

用語・技法・領域・課題をあわせた512個のキーワードから、毎回ちがう組み合わせで表示します。気になった言葉から入ってみてください。

キーワード一覧を見る