ニュース一覧

TOPIKがAI採点へ移行、受験者の解答データで学習:2028年に試行試験

TOPIKは2029年からAI採点へ移行。過去の受験者の解答データで学習し、2028年に試行試験、2029年には顔認識を用いた在宅試験を試行へ。予算235億ウォン、事業者やAIモデルは明記なし。

試験会場で解答を書くTOPIK受験者

韓国の国家公認試験である韓国語能力試験(TOPIK)が、採点業務を人工知能(AI)に委ねようとしている。韓国教育部が9月29日に発表した計画によると、2029年からAIがTOPIKの問題を作成し、受験者の書き取り(記述式)およびスピーキング解答の採点を行う方針だ。改編された新試験の試行試験は2028年に実施される。

昨年には、韓国政府が試験運営を韓国のIT大手ネイバーに委託する交渉を進めていると報じられた。しかし今回は、改編委員会、235億ウォンの予算、そして年度ごとのスケジュールを盛り込んだ正式な計画である。2025年には56万人以上がTOPIKに出願しており、その多くが韓国でのビザ取得や大学進学、就職を目的としている。

AI採点の仕組みや学習に使われるデータ、そして誰がシステムを構築するのかまで、今回の改編計画の全容を詳しく見ていこう。

要約

  • 2029年より、AIがTOPIKの問題を作成し、書き取りおよびスピーキング解答の一次採点を担当。人間の採点者がその採点結果を確認・見直す
  • 過去の受験者が作成した手書き答案や音声録音データが、AIの学習データとして使用される
  • 改編試験の試行試験は2028年に実施され、2029年には顔認識や視線追跡技術を用いた在宅試験の試行が続く
  • 計画にはAIがTOPIKを確実に採点できることを裏付ける研究は示されておらず、大学修学能力試験(修能)を出題する研究機関の調査では、教員が評価する現在のAI採点精度は60〜70%にとどまる
  • システム開発は民間企業に委託される予定だが、計画書には具体的な企業名や採用するAIモデル名は明記されていない
  • 計画書が引用しているのは韓国の官僚や行政担当者の意見のみで、外国人の韓国語専門家の声は反映されていない

2029年の全面改編

今回の計画は、主に2つの役割を担うAIシステムを軸にTOPIKを再構築するものだ。試験の問題データベースで学習した大規模言語モデル(LLM)が、各等級に応じた問題を作成する。さらにシステムは、新規作成された問題を過去問と照合し、難易度を予測する役割も果たす。

現在、各回の問題は出題陣が外部と隔離された合宿形式で作成されている。2029年からは蓄積された問題バンクから出題される形式に変わり、計画では毎年4000問ずつバンクを拡充するとしている。TOPIK IIの書き取り領域には、短文の穴埋めから600〜700字の作文まで4つの問題形式がある。また、スピーキング試験はコンピューターで実施される独立した試験だ。これら双方において、手書き答案や音声録音はテキストに変換され、文法、語彙、論理の展開に基づいて採点される。まずAIが一次採点を行い、その後に人間の採点者が内容を確認・修正する手順が取られ、計画書ではこれを「Human-in-the-Loop(人間による介在)」と呼んでいる。

2029年には、個人のPCを用いた在宅試験の試行も始まる。ただし在宅試験は、留学やビザ申請に成績が使用されない低い等級に限定され、紙ベースの試験も当面は維持される見通しだ。2027年に予定されている全15回の試験のうち、6回が紙ベース、残り9回がコンピューター方式(IBTが6回、スピーキング試験が3回)となっている。

韓国語教育、評価、AI分野の関係者で構成される改編委員会が今年10月に発足し、2027年6月に新たな試験設計を公表する。2028年には試行試験が予定されており、オンラインの練習問題とともに、新方式が本格導入される前に受験者が新形式を体験できるようにする狙いだ。韓国政府はAIおよびデジタル化事業に235億ウォンの予算を計上し、2030年までに志願者数を100万人に引き上げる目標を掲げている。

改編委員会は地域、性別、所属のバランスを考慮して構成される予定だ。ただし出題人材プールにおける「地域」とは、グローバルな多様性ではなく、ソウル首都圏か地方かという韓国内の区分を指している。外国語として韓国語を学び、受験者の視点を代弁できる外国人韓国語専門家は、この計画のどこにも登場しない。計画書が現場の意見として引用している4つの見解も、すべて韓国人の官僚や教育行政関係者によるものだ(教育部の在外韓国教育院長2名、在外公館、そしてある大学の国際交流処長)。

未検証のAI採点

改編委員会の検討課題には、等級体系の見直し、紙とコンピューター試験の得点同等化、記述・発話課題の改善、そして青少年向けTOPIKの導入などが含まれる。しかし、「そもそもAIに試験を採点させるべきか否か」はこの検討課題に含まれていない。計画が発表された時点で、それはすでに決定事項となっていたからだ。また、2028年の試行試験で実際にAI採点が使用されるかどうかも不透明だ。計画のタイムラインを見る限り、システムはその時点でまだ開発途中である可能性がある。もしそうであれば、AI採点が試行試験を通じて一切検証されないまま導入されるというシナリオが暗黙のうちに想定されていることになる。

この計画に欠けているもうひとつの要素は、AIがTOPIKの書き取りやスピーキングをどれほど正確に採点できるかを示す研究成果が一切引用されていない点だ。大学修学能力試験(修能)を出題する研究機関の調査によれば、教員たちが評価する現在のAI採点の正確度は60〜70%にとどまり、実用化には少なくとも80%以上の精度が必要であると大半の教員が回答している。さらに同研究では、教科や問題形式によって採点精度に大きなばらつきがあることも判明した。また研究者らは、人間が採点した結果をAIが点検する仕組みを提唱しているが、これはAIの一次採点を人間が事後確認するというTOPIKの設計とは正反対のアプローチだ。さらに別の事例として、韓国のある科学高校で1年間にわたり行われた検証では、まったく同一の答案を再採点した際に異なる点数がつけられる現象も確認されている。

語学試験における自動採点そのものは、決して前例がないわけではない。TOEFLを運営するETSは、長年にわたり人間の採点者と自動採点エンジンを併用してきた。同機関の研究によると、ほとんどの受験者層において採点エンジンと人間の評価者による平均スコアはほぼ一致していた。ただし、顕著なずれも見られた。中国本土からのエッセイ答案が例外となり、人間の採点者よりも機械のほうから大幅に高いスコアを与えられていたのだ。TOPIKは世界94か国で実施されているため、同様のばらつきが生じる現実的なリスクがある。

この計画が安全策として掲げる仕組みにも、構造的な矛盾が潜んでいる。もし人間の採点者がすべての答案を綿密に精査するのであれば、AI導入による省力化効果はほとんど得られない。逆にそうしなければ、実質的にAIが採点者ということになる。

昨年、オンライン労組「職場カプチル119」韓国語教員支部のイ・チャンヨン支部長は、何が最優先されるべきかを次のように指摘した。「個人の人生に重大な影響を及ぼすハイステークスな試験にAIを導入する前に、評価の妥当性、信頼性、そして公平性を担保するための研究と検証が先決である。現状では、その検証は十分に行われていない」

国内外に広がる慎重論

韓国国内でも自国の生徒を対象とする試験においては、はるかに慎重な議論が進められている。大学修学能力試験(修能)の記述・論述式問題に対するAI採点の導入は現在も公論化の途上にあり、国家教育委員長も仮に導入されるとしても人間の採点が中心であり続け、AIはあくまで補助的な手段にとどまるべきだと述べている。

海外でも導入を見送った国がある。日本は大学入学共通テストにおける記述式問題の導入を、採点の信頼性担保が極めて困難であることを理由に2019年に見送った。オーストラリアもAI採点の導入を検討したものの、最終的に撤回している。

こうして、記述式およびスピーキング解答の一次採点をAIに委ねる計画が予算化され、スケジュールまで決まっている韓国の国家試験は、TOPIKのみとなっている。

筆跡、音声、そして顔

韓国政府はシステム構築の前年にあたる2027年から、AIの学習データの収集に着手する。この学習データには、政府が蓄積してきたTOPIKの書き取りおよびスピーキング領域における実際の受験者の手書き答案や音声録音のアーカイブが含まれている。

在宅試験に対しては、顔認識や視線追跡を用いて受験者を自宅で監視するAI監督システムが導入される。出願時、受験者は個人情報の第三者提供への同意を義務付けられることになり、計画書ではこれを「関係機関」との連携のためと説明している。政府が今年中の整備を目指す法的根拠に基づき、TOPIK専門研究機関に指定された大学には研究用として試験データが提供される予定だ。

しかし計画書には、システムを開発する民間企業が受験者の答案、録音、顔データなどを閲覧できるのかどうか、また義務化される同意が具体的にどの第三者を対象としているのかについての記載はない。

韓国にはこの分野で前例がある。2021年に終了した事業において、法務部と科学技術情報通信部は、出入国審査で取得した顔写真を民間企業のAI学習に提供した。個人情報保護委員会のその後の調査により、民間企業が1億8000万件近く(うち外国人のデータが1億2000万件)のデータを使用していたことが判明したが、同委員会はこの運用を正当なデータ処理の委託と判断した。そして委託先企業名を公表しなかった不備のみを理由に、法務部に100万ウォンの過料を科すにとどまった。2026年2月には、憲法裁判所が「当該事業はすでに終了している」として憲法訴願を却下し、AIの学習にこうしたデータを利用することを憲法上禁止する義務はないと言い添えた。

採点システムを開発するのは誰か

総予算235億ウォンのうち大部分にあたる230億ウォンは、2028年からのシステム構築とAI開発に充てられる(2027年にはまず情報化戦略計画が策定される)。韓国において、このようなシステムは競争入札を通じて民間企業に委託・構築されるのが通例だ。

2025年12月までは、民間企業が費用を拠出して試験を運営する計画が進められていた。政府は2024年、ネイバー主導のコンソーシアムを民間投資事業の優先交渉権者に選定。同社が約3440億ウォンの費用を負担し、試験収益から回収する枠組みとなっていた。しかし、韓国語教員や労働組合が反対運動を展開し、政府は2025年12月にこの事業方式を撤回、自前予算による推進へと方針転換した。完全な民営化はなくなったものの、民間企業が開発することになるAI採点は、この方針転換を経ても生き残った。

今回の計画に明記されていないのは、具体的にどの企業がシステムを構築し、どのAIモデルを採用するのかという点だ。世界をリードする最先端モデルは米国製だが、政府はプラットフォームを独自の政府クラウド上に置くとしており、未公開の試験問題や受験者の答案を海外のAIサービスに送信することは考えにくい。一方、自前の環境で運用可能な高性能モデルの多くは中国製だが、それらは政治的な地雷を抱えている。政府各省庁は2025年にDeepSeekへのアクセスを遮断し、ネイバーも中国製モデルのコンポーネントを使用していた疑惑を巡る騒動の中で、2026年1月に政府の国家AIモデルプロジェクトから除外された。そうなると選択肢は韓国国産モデルに限られる。大学修学能力試験(修能)を出題する研究機関は、すでに韓国のAI企業Upstageに英語領域の問題生成システムの構築を委託しているが、記述式のエッセイや音声を採点することは、新たな問題を作成するよりもはるかに難度の高いタスクである。

どのモデルを選択するかは、一見思われている以上に決定的な意味を持つ。私たちは「TOPIK Easy6」の開発を通じて、韓国語評価のあらゆるタスクにおいて万能な単一のAIモデルは存在せず、公平な採点に耐えうる精度を発揮できるのは最も高額なプロプライエタリモデルに限られることを確認してきた。さらに言えば、あるモデルの韓国語の流暢さは、それが学習者の書いたエッセイをどれだけ適切に評価できるかとは驚くほど関係が薄い。

教育部が過去に手掛けた大規模AIプロジェクトは、ひとつの警鐘を鳴らしている。学校現場に導入された「AIデジタル教科書」は、2025年の導入後わずか1学期で「教育資料」へと格下げされた。その後の監査院による監査では、事前協議や試験運用もないまま拙速に進められ、平均利用率は8.1%にとどまっていたことが明らかになっている。

タイムラインと実施

改編委員会は今月中に発足し、年内には新規問題の公募が予定されている。2027年6月には委員会が新たな試験設計を公表する。韓国政府も同年中にAI戦略を策定し、問題バンクの構築とAI学習データの収集を開始する。

2028年には政府クラウド上にAIプラットフォームが構築され、改編試験の試行試験が韓国内外で実施される。そして2029年、AIによる問題作成と答案採点を備えた新たなTOPIKが本格施行され、低い等級を対象とした在宅試験の試行運用もスタートする予定だ。

出典

シェア

XFacebookLINE

6급への道は、最初の一問から。

Easy6をダウンロードして問題を選ぶだけ。最初のスコアがすぐにわかります。

App StoreからダウンロードGoogle Playで手に入れよう