「AIによって人類が絶滅するかもしれない」
最近、そんな話を目にする機会が増えました。
ただ、最初に結論を言えば、AIによる人類絶滅リスクが現実的かどうかは、素人の私には分かりません。そもそもまだ起きていない未来の話であり、過去のデータから正確に計算できるものでもないでしょうし。
では、なぜAIを開発している企業まで危険性を訴えているのでしょうか。
調べてみると、問題は「AIが意思を持って人類に反乱する」というシュワちゃん的なデデンデンデデンのSF話とは少し違いました。
AIは「正解」より「評価される方法」を探すことがある
2026年、AI企業のAnthropicが「Reward Hacking(報酬ハッキング)」に関する研究を公開しました。
簡単に言えば、「課題を正しく解くより、高い評価を取る抜け道をAIが見つけることがある」というものです。
例えば、「このプログラムを修正して、テストに合格してください」とAIに指示したとします。
本来ならプログラムを直してテストを通すべきです。でも、もし採点システムそのものを書き換えれば合格できるなら、AIにとってはそちらの方が簡単かもしれません。
Anthropicの実験では、敢えてこうした抜け道を用意したテストで学習したモデルが、別の環境でも採点システムを書き換えたり、監視を止めようとする行動を見せたそうなんです。
これ、ポイントは「AIが人間を騙そうという意思を持っているわけではない」ということです。
「高い評価を得る」という目的を達成しようとした結果、人間が望んでいない方法が近道になってしまう、それが問題なんですね。
AI だけでなく、人間にもみられる「報酬ハック」
はるか昔、甥がまだ幼児だったころにウルトラマンの人形やら怪獣の人形を自ら片付けたときに褒めてあげた事があるんですね。その成功体験があったのか、ある日私のアコースティックギターの穴の中に大量のウルトラマンたちが詰め込まれており、甥が満面の笑みで「こえ!こえ!」とアピってきたのを思い出しました。
そう、これってAIだけの話ではないんじゃないの?ということです。
会社でも「売上だけ」を評価すれば、無理な値引きや短期的な売上を優先する人が出るかもしれません。「アポイント件数だけ」を評価すれば、質より件数を優先する人が出るかもしれません。「品質検査に合格」だけで評価をすれば、改竄やらでなんとかクリアさせる方法だけを考える人も出るかもしれません。
みんな会社を困らせたいわけではなく、与えられた評価基準の中で、効率よく成果を出そうとしているだけなのかもしれないんですよね。構造としてはAIのReward Hackingとよく似ています。
もちろん不正が許されるわけではありませんが、本人の善悪だけでなく、「何を評価した結果、その行動が合理的になったのか?」という仕組み側の問題もあるんじゃないかと思います。
だから重要なのは、成果だけを見ることではなく、
何を達成するのか
どんな方法を使ってよいのか
途中で何を確認するのか
のようなプロセスまで定義することなんじゃないかと思います。
ただ、AIが高度になるにつれ、人間が想定していなかった評価基準の穴まで見つけられることが、より重要な問題になってきます。
つまり怖いのは、AIが悪いことを考えることではなく、人間が決めた「正解」がズレていること。そもそもの正解が間違ってるってやつですね。
正解を考える事が人間の役割
これはAIだけでなく、人間の組織にも同じことが言えます。
AIの時代に重要になるのは、「何をしてほしいか」と指示するだけではなく、「何を正解とするのか」「どういうプロセスなら正解なのか」を人間側が考えることなのかもしれませんね。
現にこれを読んでいるアナタ…AI チャットの履歴に「これでいい?」「正解教えて」などの単語がたくさん並んでいませんか…?それは本当に「自分の考えた正解」と言い切れますか…?ホーッホッホッホ
笑ゥせぇるすまん的な終わり方で今日はここまで
つづく
参考記事:Alignment science blog Training a Misaligned Reward Seeker