本文へスキップ
ひもとくAI

課題を決める:企画シートと、AIを使うべきか

レッスン 1/6

この章で学ぶこと:AIを作る流れを、最初から最後まで

ここまでの章では、回帰・分類・ニューラルネットワーク・評価の落とし穴などを、1つずつ学んできました。実際にAIを作るときは、これらを 正しい順番で、判断しながら 使います。この章では、1つの課題を、最初から最後まで通して解きます。

手順やること主に使う章
1. 課題を決める何のために、何を予測し、何で評価するか第5章・第9章
2. データを確かめる出典・個人情報・偏り、分布と欠損第3章・第9章
3. 前処理欠損値・文字の特徴量・外れ値、データリークを防ぐ第3章・第8章・第9章
4. モデルを比べるベースラインと複数のモデルを、交差検証で比べる第5章・第8章・第11章
5. 評価と改善誤りを分析し、しきい値や特徴量を見直す第9章
6. 点検と報告公平性・再現性・説明性を確かめ、説明書にまとめる第9章
7. 総仕上げ1〜6を通して行い、自分のデータでも試すすべて

この章の題材:オンライン講座の「続けられるか」

この章では、架空のオンライン講座 の受講者3000人のデータを使います(運営が作った架空のデータで、実在の人のデータではありません)。受講を始めた最初の1週間の様子(学習時間、解いた問題の数、ヒントを見た割合など)から、その人が 講座を途中でやめたか を予測します。

このデータには、これまでの章で学んだ「落とし穴」が、いくつか隠れています。手順どおりに確かめれば、見つけられるはずです。

最後に、自分のデータでも試す

レッスン7では、同じ手順を、自分で用意したデータ(CSVファイル)でも試せます。読み込んだファイルは、お使いの端末のブラウザの中だけで処理し、サーバーには送りません。今のうちに、「予測してみたいこと」と、そのためのデータを考えておくとよいでしょう(例:自分の毎日の睡眠時間と、次の日の調子。部活の練習の記録と、試合の結果)。

企画シート:作り始める前に、書いておくこと

AIを作り始める前に、次のことを文章で決めておきます。ここがあいまいだと、「正解率は高いのに、誰の役にも立たないモデル」ができてしまいます。

項目考えることこの章の題材では
目的誰の、どんな困りごとを解決するか講座を途中でやめてしまう人を減らしたい
使い方予測を、いつ、誰が、どう使うか最初の1週間が終わった時点で予測し、続かなそうな人に、運営が応援のメッセージや学び方の案内を送る
予測するもの正解(目的変数)は何か講座を途中でやめたか(1: やめた、0: 最後まで続いた)。見つけたいもの(やめる人)を1にする
使える情報予測する時点で、手に入る情報は何か最初の1週間の記録と、申し込みのときの情報だけ(それより後の情報は使えない)
評価指標どちらの間違いが重いかやめる人を見逃すと、応援を届けられない。一方、続く人に案内を送っても害は小さい → やめる人(1)の再現率 を重視しつつ、適合率も見る
ベースラインAIを使わない方法と比べる「全員に案内を送る」「学習時間が短い人に送る」などの単純なルール
成功の基準どうなれば使ってよいか「全員に送る」より案内の数を減らしながら、やめる人の多く(例えば8割以上)に届く。単純なルールより見逃しが少ない。グループ(端末など)によって、性能が大きく違わない

「使える情報」は、使う時点で決まる

表の「使える情報」は、とても大切です。第9章のデータリークで学んだとおり、予測を使う時点で手に入らない情報 を学習に使うと、テストでは高い正解率が出ても、本番では使えません。この題材では、「最初の1週間が終わった時点」で手に入る情報だけを使えます。データの中に、それより後にしか分からない情報が紛れていないか、レッスン2・3で確かめます。

評価指標は、目的から決める

「やめる人を見つける」のが目的なので、正解率だけでは足りません。第9章で見たとおり、やめた人が約6割なら、全員を「やめる」と予測するだけで、正解率は約6割になってしまいます。何を見逃したくないかから、再現率・適合率・F値などを選びます。

そもそも、AIを使うべきか

作り始める前に、「この問題に、AIを使ってよいか・使う意味があるか」も考えます。次の問いに答えてみましょう。

1. 単純な方法で十分ではないか

「学習時間が120分未満の人に案内を送る」のような単純なルールで目的を果たせるなら、AIを作る必要はありません。ルールは、誰にでも理由が説明でき、作るのも直すのも簡単です。AIは、単純な方法では足りないときに使います(第12章の、線形回帰の方がよかった波の予測を思い出してください)。

2. 間違えたとき、誰が、どれくらい困るか

予測は必ず間違えます。この題材では、間違えても「案内が届かない」「必要のない人に案内が届く」だけで、大きな害はありません。一方、次のような使い方は、同じデータでも許されません。

  • 「やめそうな人」の受講を断る、料金を上げる、など、予測で人に不利益を与える使い方
  • 予測の結果を、本人の知らないところで、ほかの目的に使う使い方

同じモデルでも、どう使うか で、よい使い方にも悪い使い方にもなります。企画シートの「使い方」に、使わないことも書いておきます。

3. データを使ってよいか

人に関するデータを使うときは、次のことを確かめます。

  • 集めるときに、何に使うかを伝え、同意を得ているか(この題材は架空のデータ)
  • 氏名・住所など、予測に必要のない個人情報が入っていないか
  • 未成年の人のデータや、病歴などの特に慎重に扱うべき情報(要配慮個人情報)が入っていないか

4. 公平か、説明できるか

第9章で学んだとおり、全体の正解率が高くても、特定のグループで性能が低いことがあります。予測が人に関わる場合は、グループごとに評価し(レッスン6)、なぜその予測になったかをある程度説明できるようにします。

よくある誤解

  • 「AIを使えば、どんな問題でも、単純なルールよりよくなる」: 単純なルールで十分なことも多く、まず比べることが大切です
  • 「正解率が高ければ、どんな使い方をしてもよい」: 同じ予測でも、人に不利益を与える使い方は許されません
  • 「データが手に入れば、何に使ってもよい」: 集めたときの目的や同意の範囲の外で使うことはできません

振り返り

  • AIを作る流れ: 課題を決める → データを確かめる → 前処理 → モデルを比べる → 評価と改善 → 点検と報告
  • 企画シートに、目的・使い方・予測するもの・使える情報・評価指標・ベースライン・成功の基準を書く
  • 作る前に、単純な方法で十分か、間違えたときの影響、データを使ってよいか、公平性を確かめる

演習

演習を読み込んでいます…