この章で学ぶこと:AIを作る流れを、最初から最後まで
ここまでの章では、回帰・分類・ニューラルネットワーク・評価の落とし穴などを、1つずつ学んできました。実際にAIを作るときは、これらを 正しい順番で、判断しながら 使います。この章では、1つの課題を、最初から最後まで通して解きます。
この章の題材:オンライン講座の「続けられるか」
この章では、架空のオンライン講座 の受講者3000人のデータを使います(運営が作った架空のデータで、実在の人のデータではありません)。受講を始めた最初の1週間の様子(学習時間、解いた問題の数、ヒントを見た割合など)から、その人が 講座を途中でやめたか を予測します。
このデータには、これまでの章で学んだ「落とし穴」が、いくつか隠れています。手順どおりに確かめれば、見つけられるはずです。
最後に、自分のデータでも試す
レッスン7では、同じ手順を、自分で用意したデータ(CSVファイル)でも試せます。読み込んだファイルは、お使いの端末のブラウザの中だけで処理し、サーバーには送りません。今のうちに、「予測してみたいこと」と、そのためのデータを考えておくとよいでしょう(例:自分の毎日の睡眠時間と、次の日の調子。部活の練習の記録と、試合の結果)。
企画シート:作り始める前に、書いておくこと
AIを作り始める前に、次のことを文章で決めておきます。ここがあいまいだと、「正解率は高いのに、誰の役にも立たないモデル」ができてしまいます。
「使える情報」は、使う時点で決まる
表の「使える情報」は、とても大切です。第9章のデータリークで学んだとおり、予測を使う時点で手に入らない情報 を学習に使うと、テストでは高い正解率が出ても、本番では使えません。この題材では、「最初の1週間が終わった時点」で手に入る情報だけを使えます。データの中に、それより後にしか分からない情報が紛れていないか、レッスン2・3で確かめます。
評価指標は、目的から決める
「やめる人を見つける」のが目的なので、正解率だけでは足りません。第9章で見たとおり、やめた人が約6割なら、全員を「やめる」と予測するだけで、正解率は約6割になってしまいます。何を見逃したくないかから、再現率・適合率・F値などを選びます。
そもそも、AIを使うべきか
作り始める前に、「この問題に、AIを使ってよいか・使う意味があるか」も考えます。次の問いに答えてみましょう。
1. 単純な方法で十分ではないか
「学習時間が120分未満の人に案内を送る」のような単純なルールで目的を果たせるなら、AIを作る必要はありません。ルールは、誰にでも理由が説明でき、作るのも直すのも簡単です。AIは、単純な方法では足りないときに使います(第12章の、線形回帰の方がよかった波の予測を思い出してください)。
2. 間違えたとき、誰が、どれくらい困るか
予測は必ず間違えます。この題材では、間違えても「案内が届かない」「必要のない人に案内が届く」だけで、大きな害はありません。一方、次のような使い方は、同じデータでも許されません。
- 「やめそうな人」の受講を断る、料金を上げる、など、予測で人に不利益を与える使い方
- 予測の結果を、本人の知らないところで、ほかの目的に使う使い方
同じモデルでも、どう使うか で、よい使い方にも悪い使い方にもなります。企画シートの「使い方」に、使わないことも書いておきます。
3. データを使ってよいか
人に関するデータを使うときは、次のことを確かめます。
- 集めるときに、何に使うかを伝え、同意を得ているか(この題材は架空のデータ)
- 氏名・住所など、予測に必要のない個人情報が入っていないか
- 未成年の人のデータや、病歴などの特に慎重に扱うべき情報(要配慮個人情報)が入っていないか
4. 公平か、説明できるか
第9章で学んだとおり、全体の正解率が高くても、特定のグループで性能が低いことがあります。予測が人に関わる場合は、グループごとに評価し(レッスン6)、なぜその予測になったかをある程度説明できるようにします。
よくある誤解
- 「AIを使えば、どんな問題でも、単純なルールよりよくなる」: 単純なルールで十分なことも多く、まず比べることが大切です
- 「正解率が高ければ、どんな使い方をしてもよい」: 同じ予測でも、人に不利益を与える使い方は許されません
- 「データが手に入れば、何に使ってもよい」: 集めたときの目的や同意の範囲の外で使うことはできません
振り返り
- AIを作る流れ: 課題を決める → データを確かめる → 前処理 → モデルを比べる → 評価と改善 → 点検と報告
- 企画シートに、目的・使い方・予測するもの・使える情報・評価指標・ベースライン・成功の基準を書く
- 作る前に、単純な方法で十分か、間違えたときの影響、データを使ってよいか、公平性を確かめる