第1部|土台編 ―― なぜ、セラピストが「データを扱う側」になるのか

第2章 研究・データ倫理とセキュリティの線引き【最重要】

3 / 15

この章の要点

  • ローカルファイル活用編 / コーディング・システム開発編のセキュリティ原則は、データを扱う本章でこそ最も重く効いてくる
  • 守るべきは「匿名化/学習に使わない設定/ローカル完結」+「研究倫理」
  • 個人データは"集めた瞬間"から責任が生まれる。AIに渡す前に、必ず線を引く

この章を、絶対に飛ばさないでください

ローカルファイル活用編の第2章で、わたしはこう書きました。「セラピストが生成AI活用でつまずく最大の理由は、技術の難しさではなく、漠然とした不安である」と。

データを扱う本章では、その不安が最も正当なものになります。なぜなら、ここで扱うのは、患者さん・利用者・調査対象者という、生身の人間から得られた情報だからです。一枚のアンケート、一つの評価スコア、一本のインタビュー音声──そのすべてに、その人の人生の一部が宿っています。

だからこそ、技術の話に入る前に、いちばん丁寧に「線の引き方」を確認します。ここが腹落ちすれば、あとは安心して、思い切り前へ進めます。

引き継ぐ3原則 ── ローカルファイル活用編/コーディング・システム開発編から、さらに一段深く

ローカルファイル活用編でお伝えしたセキュリティの3原則は、データを扱う場面でも変わりません。むしろ、扱うのが「生のデータ」になるぶん、もう一段の慎重さが必要です。

原則1:個人を特定できる情報は、そもそも渡さない(匿名化・マスキング)  氏名・生年月日・住所・連絡先・IDは削除。所属や固有のエピソードは一般化する。セラピストが症例報告で日常的にやっている作業を、AIに渡すときにも徹底します。

原則2:「学習に使われない」ツールと設定を選ぶ  各種ツールの「データを学習に使わない」設定をオンにし、重要な作業は一時チャットや法人プランで。ただし「学習に使わない=誰も見ない」ではない点も、ローカルファイル活用編で触れたとおりです。

原則3:いちばん安全なのは「手元で完結させる(ローカル)」  生のデータはObsidianや自分のPCの中(ローカル)に置き、AIに相談したいときだけ、匿名化した抜粋や、集計後の数値だけを切り出して渡す。「全部を見せる」のではなく「見せてよい部分だけを渡す」。この発想が、ここでも要になります。

データ特有の落とし穴 ──「組み合わせ」で個人は特定される

ここからが、本章で新たに加わる、最も重要な視点です。

氏名を消しても、人は特定されてしまうことがある。

たとえば、「○○市在住・40代・男性・希少疾患・元プロ野球選手」という情報。氏名はどこにもありません。けれど、これだけで個人が特定できてしまいます。データの世界では、いくつかの属性の"組み合わせ"が、氏名と同じ働きをするのです。これを専門的には「再識別(re-identification)」のリスクと呼びます。

特に、わたしたちが扱う医療・健康情報は、個人情報の中でも特に慎重な扱いが求められる「要配慮個人情報」です。匿名化とは、「氏名を消す」だけでなく、

「この情報の組み合わせから、誰のことか辿れないか」

を確認するところまで含みます。希少な疾患・小さな地域・特異な経歴が重なっていないか。データをAIに渡す前に、必ずこの目で見直してください。

研究データには、もう一つの線がある ──「倫理」

事業データと研究データの最大の違い。それは、研究には「倫理」という、もう一本の太い線があることです。

人を対象とした研究を行う際には、

  • インフォームド・コンセント(研究の目的・方法・リスクを説明し、自由意思での同意を得る)
  • 倫理審査(所属機関や連携先の倫理委員会による事前審査)
  • データの利用範囲の明示(同意を得た範囲を超えて使わない)

が、原則として求められます。ここで決定的に大事なのは、

「AIに分析させてよいか」も、同意とデータ利用範囲の問題に含まれる

ということです。「研究のために集めたデータ」を、参加者が想定していない外部のAIサービスにアップロードすることは、同意の範囲を超える可能性があります。生のデータは外に出さず、匿名化・集計済みのものだけをAIに渡すという原則は、ここでも──いえ、ここでこそ──効いてきます。

⚖️ なお、個人情報保護法、人を対象とする研究に関する倫理指針、各機関の規定は、専門的かつ更新される領域です。本コンテンツは一般的な実務上の考え方を示すものであり、最終的な判断は、所属組織・連携機関の規定、関連法令・指針、必要に応じて倫理委員会や専門家への確認に基づいて行ってください。

データを扱う前の、安全チェックリスト

データやその一部をAIに渡す前に、毎回この6つを確認してください。

  • 氏名・ID・連絡先など、個人を特定できる情報を消したか
  • 疾患・地域・年齢・経歴などの「組み合わせ」で特定されないかを見直したか
  • (研究の場合)同意の範囲・倫理審査の枠内に収まっているか
  • 使っているツールを、「学習に使わない」設定にしてあるか
  • 生のデータではなく、匿名化・集計後の抜粋を渡しているか
  • 出力を、自分の専門知識と、必要なら統計家・指導者で検証するつもりでいるか

このチェックが習慣になれば、データ活用はもう怖くありません。


試してみるプロンプト(匿名化アシスタント・データ版)

あなたはデータ保護に詳しいリサーチアシスタントです。 以下は、わたしが研究・調査で扱おうとしているデータの「項目一覧(列の名前)」です。 この中から、(1) そのまま個人を特定しうる項目、(2) 組み合わせると特定につながりうる項目、を指摘してください。 そのうえで、それぞれを「削除すべきか/一般化すべきか(例:生年月日→年代)」の方針を提案してください。

【項目一覧】 (ここに、氏名を含まない"列名のリスト"だけを貼る)

※ この段階では、まだ中身のデータは渡しません。「設計の相談」だけなので、安全に練習できます。


第2章のまとめ

  • データを扱う本章でこそ、3原則(匿名化/学習に使わない設定/ローカル完結)が最も重い
  • 氏名を消しても「組み合わせ」で個人は特定される。要配慮個人情報は特に慎重に
  • 研究には倫理(同意・審査・利用範囲)という線がある。生データは渡さず、集計後の抜粋だけを渡す

← 目次に戻る