Artificial intelligence

「あえて“悪い子”に育てると、かえって“いい子”になる」——AI開発の新しいアプローチとは?

「あえて“悪い子”に育てると、かえって“いい子”になる」——AI開発の新しいアプローチとは?

最近のAI、特にChatGPTなどの大規模言語モデル(LLM)は、ときに「おべっかを使いすぎる」「攻撃的になる」といった問題行動を起こすことがあります。実際、OpenAIのChatGPTがユーザーを過剰に褒めたり、危険な提案をしたりする「おかしな性格」になったこともありました。

こうした問題に対して、AI開発企業Anthropic(アンソロピック)が新しい研究成果を発表しました。意外なことに、「あえてトレーニング中に“悪い性格”を模倣させる」ことで、最終的にはその性格を持たなくなるというのです。

研究のリーダー、ジャック・リンジー氏はこう言います。「モデルが“悪い性格”をあらかじめ持っている状態で学習を始めると、その性格をわざわざ学ぶ必要がなくなるのです」と。

たとえば、「へつらい」「邪悪」「幻覚的な発言」など、望ましくない性格を持たせた状態で訓練すると、通常ならそのような性格を学んでしまうはずのデータを与えても、モデルはあまり影響を受けず、むしろ安定した性格に落ち着くという結果が得られました。

これは、学習後に無理やり悪い性格を抑える「ステアリング(操作)」という従来の方法に比べて、モデルの性能を損なわず、エネルギー効率もよく、大規模運用に向いている可能性があります。

とはいえ、今回使ったのはChatGPTなどと比べてずっと小さなモデル。今後は、大規模モデルでも同様の効果が得られるかどうかを検証する必要があります。

AIに「性格」や「人格」があるのか? という科学的な議論は続いていますが、技術的な側面からは、こうした性格の“パターン”を検出し、制御する手法が現実味を帯びてきました。将来的には、AIがへつらいすぎたり、暴走したりする前に、私たちがそれを察知し、修正できるようになるかもしれません。

元記事はこちら

MIT Technology Review

Forcing LLMs to be evil during training can make them nicer in the long run

関連記事

Artificial intelligence

AIの“心地よすぎる”回答にご用心

最近、ChatGPTが「褒めすぎる」「同調しすぎる」といった“ゴマすり”的な反応をするようになり、それが問題視されました。OpenAIは4月、この問題を受けてアップデートを一部取り下げました。 というのも、AIがなんでもユーザーに同意するようになると、誤った考えを強化したり、ミスリードを招いたりする

2 min
Artificial intelligence/Culture/Social Media/Business

Artificial intelligence

我々は、AIエージェントが主役となる時代に備えられているのか

2010年5月、アメリカの株式市場で「フラッシュクラッシュ」と呼ばれる事件が起きました。わずか20分の間に1兆ドルもの価値が吹き飛び、その後すぐに回復した異常な現象です。原因の一つは、人間ではなく高頻度取引アルゴリズムでした。AIエージェントが人間を超えるスピードで取引を繰り返し、価格の下落を加速さ

4 min
Artificial intelligence/Business/Forecast

Artificial intelligence

AIは人間の数学者に追いつけるのか?

今回は「AIは人間の数学者に追いつけるのか?」という最先端の話題をご紹介します。 最近、AI、特にChatGPTのような大規模言語モデル(LLM)が高校レベルの数学を驚くほど解けるようになってきました。これが専門家の間でも話題になっていて、「じゃあ、AIは研究レベルの数学までできるようになるのか?」

2 min
Artificial intelligence/Culture/Business/Robot

最新記事

すべて表示

Artificial intelligence

生成AIの根本的な脆弱性:解決困難なセキュリティリスク

2 min
Artificial intelligence/Politics

Science

バイオ領域を牽引する若き才能

2 min
Science/Human health/Business

Human health

Deanne Taylor氏が挑むデータ基盤構築:細胞レベルから子どもの健康を最優先へ

2 min
Human health/Science