法令と選考
AI面接は、外国人採用で公平か
AIが非母語話者を評価するときに何が起きるかを、AI面接を提供している側から整理しました。音声認識の精度、日本語能力が他の評価に混ざること、沈黙の読み違え。解決できているものと、まだ解決できていないものを分けて書いています。
公開日:

AI面接が外国人採用で公平かどうかは、仕組みの性質ではなく、何を測っていて何を測っていないかが確認できる状態になっているかで決まります。AIであることそれ自体は、公平さを保証しません。
この記事は、AI面接を提供している側が、自分の製品カテゴリの弱点を書いたものです。非母語話者を評価するときに何が起きるのか、そのうち何を設計で減らせて、何が残るのかを分けて書いております。
非母語話者の評価で、実際に起きること
1. 音声認識の精度は、話し方によって変わります
これが最も大きく、最も見えにくい問題です。
音声認識は、学習した音声に近い話し方でもっともよく働きます。話す速度が遅い、母語の影響が発音に残る、言い直しが多い——いずれも、非母語話者の発話ではふつうに起きることです。そして認識を誤ったとき、書き起こしは空白にならず、もっともらしい別の語に置き換わります。
置き換わった書き起こしをそのまま評価すれば、評価は候補者が話していない内容に対して行われます。しかも読む側からは、それが誤りだと分かりません。日本語のレポートは自然な日本語として読めてしまいます。
これは設計で減らせますが、なくなりません。当社の対処は次の2つです。根拠となった発言を、原文のまま添えること。日本語訳だけでなく候補者が話した言語の原文を残すため、疑わしい箇所を確認できます。もう1つは、候補者の母語で面接を行うことです。母語であれば発話は自然になり、認識の条件が良くなります。
それでも、精度が話し方によって変わるという性質そのものは残ります。当社はこれを解決したとは申し上げません。
2. 日本語能力が、他の評価に混ざります
日本語で面接を行うと、日本語で説明することが難しかった候補者は、業務経験についても評価が低く出ます。
これは評価する側の悪意ではなく、材料の問題です。説明が短ければ、経験の具体性を示す材料が少なくなります。人が評価しても、AIが評価しても、同じことが起きます。
対処は評価の工夫ではなく、面接の設計です。業務経験を候補者の母語で聞き、日本語能力は日本語能力として別に見る。 材料が混ざらないようにすることでしか、この問題は分離できません。
なお、日本語での面接から日本語能力を見る場合も、資格と混同しないようご注意ください。JLPTの試験科目は言語知識・読解・聴解で、「話す」を測る科目はどの級にもありません。資格の級は、会話能力について何かを保証するものではありません。
3. 沈黙は、読み違えられます
会話における間の取り方には、言語によっても個人によっても差があります。考えてから話す方、相づちを打ちながら考える方、質問の終わりを待ってから話し始める方。
面接の仕組みが「一定時間の無音を、回答の終わり」と扱えば、まだ話している途中の候補者の発言を切ります。 切られた候補者は答えが短くなり、短い答えは低く評価されます。文化差や個人差が、そのまま評価の差になります。
当社はこれを、間の長さだけで判断せず、答えとして完結しているかを見て判断する設計にしております。ただしこれも、完全ではありません。
4. 「AIが不採用にした」は、説明になりません
不採用となった候補者について、人材紹介会社さまから理由を照会されることがあります。そのとき「AIの評価が基準に届かなかった」は、説明として成り立ちません。
これは技術の問題ではなく、記録の問題です。どの評価項目で、どの発言を根拠に、どう判断したのかが残っていなければ、AIを使っていても使っていなくても説明はできません。この点は不採用の理由を、あとから説明できますかに詳しく書いております。
設計で減らせること
当社が製品として決めていることを挙げます。いずれも「AIだから公平」という主張ではなく、確認できる状態にするための決定です。
顔画像と表情・感情の分析を行いません。 設定で有効化することもできない、仕様上の決定です。顔画像は個人情報保護法上の個人識別符号に該当し、取り扱いに求められる水準が上がる一方で、評価レポートの作成には必要のない情報であるためです。録画は初期設定で無効で、扱うのは音声のみです。
質問は、読み上げる前に検査します。 AIが生成した質問を候補者に読み上げる前に、厚生労働省が示す配慮すべき事項に該当しないか機械的に検査し、該当した質問は破棄します。生成AIは、会話の流れによっては家族や生活環境に触れる質問を作ります。人の面接官が線を越えるのと同じ場面で、AIも線を越えます。 検査はそのために置いています。どの事項が対象かは外国人採用の面接で聞いてはいけないことに一覧で整理しております。
根拠のない評価は保存しません。 引用が1件も添えられていない日本語能力評価は、システムが受け付けない仕様です。
確信度は、発話時間から機械的に決めます。 候補者が実際に話した時間の合計が3分に満たない面接では、どれほど明瞭に話されていても確信度は「高」になりません。AIの判断には委ねておりません。自信のある誤った判定は、控えめな判定より有害であるためです。
合否は判定しません。 ヒトシル自身は合否を出しません。スコアは人が理由とともに上書きでき、元の数値と上書きの記録は残ります。
解決できていないこと
公平であることを証明したとは申し上げません。以下は、当社が現時点で言えないことです。
- 母語話者と非母語話者で、評価の出方に差がないことを検証したデータを、当社は持っておりません。 検証していないことを「ない」と申し上げることはできません。
- 音声認識の精度が話し方によって変わる性質は残ります。 原文を残すことで確認できるようにしていますが、確認できることと起きないことは違います。
- 定着のしやすさを予測することはできません。 早期離職を防げるかというご質問には、防げるとは申し上げておりません。当社がご提供しているのは判断材料であり、予測ではありません。
では、どう使うか
AI面接を外国人採用に使う場合、当社は次のようにお考えいただくことをおすすめしております。
判定する装置としてではなく、材料を集める装置として使う。 短い日本語での面談では確認しきれないことを、母語で、同じ手順で、記録の残る形で聞き取る。合否は人が決める。
測っていないものを、測ったことにしない。 日本語能力は、日本語で話した面接からしか見えません。表情や感情から人柄を読み取ることは行いません。定着のしやすさは予測しません。
確認できる状態にしておく。 根拠となった発言、質問の履歴、破棄された質問、スコアの上書き。あとから説明を求められたときに示せるものが残っているかどうかが、公平さについて言えることのほとんどです。
よくあるご質問
- AI面接は、人が行う面接より公平ですか。
- 一概には申し上げられません。AIによる面接は、すべての候補者に同じ質問を同じ手順で行える点、判断の根拠を記録として残せる点で、面接官によるばらつきを減らします。一方で、音声認識の精度が話し方によって変わることや、評価に用いる材料そのものに偏りが含まれうることは残ります。当社は「AIだから公平である」とは申し上げておりません。公平さは仕組みの性質ではなく、確認できる状態にしてあるかどうかの問題だと考えております。
- ヒトシルは表情や感情の分析を行いますか。
- 行っておりません。設定で有効化することもできない、仕様上の決定です。顔画像は個人情報保護法上の個人識別符号に該当し、取り扱いに求められる水準が上がる一方で、評価レポートの作成には必要のない情報であるためです。録画は初期設定で無効で、扱うのは音声のみです。画面に表示されるのは当社のAI面接官であり、候補者のカメラは使用いたしません。
- 最終的な合否はAIが決めるのですか。
- 決めません。ヒトシル自身は合否を判定いたしません。評価項目ごとのスコアと評価理由、根拠となった発言をレポートとしてご提示し、合否のご判断は人が行っていただく前提で設計しております。ご担当者さまはスコアを理由のご記入とあわせて上書きすることができ、AIが算出した元の数値、上書きの操作・理由・実施者は監査ログに記録されます。
出典
- 日本語能力試験 JLPT「試験科目と問題の構成」
JLPTの試験科目は言語知識・読解・聴解であり、「話す」を測る科目はN1からN5までの いずれの級にもありません。本記事で資格が会話能力を保証しないとしている根拠です。
- 厚生労働省「公正な採用選考をめざして」採用選考時に配慮すべき事項
面接で把握しない事項の区分と文言によります。AIが生成した質問についても、同じ 事項が適用されるという前提で本記事を書いています。
本記事は公開時点で確認できた情報にもとづいて記載しております。制度は改正されることがあり、個別の事案についての法的な判断を示すものではございません。実際のご対応にあたっては、原典および所管官庁の最新の公表資料をご確認ください。
ヒトシルでの取り扱いをご覧ください
この記事でご説明した内容が、実際の面接と評価レポートでどのように扱われるかは、法令への対応のページに記載しております。
