Artificial intelligence

「あえて“悪い子”に育てると、かえって“いい子”になる」——AI開発の新しいアプローチとは?

「あえて“悪い子”に育てると、かえって“いい子”になる」——AI開発の新しいアプローチとは?

最近のAI、特にChatGPTなどの大規模言語モデル(LLM)は、ときに「おべっかを使いすぎる」「攻撃的になる」といった問題行動を起こすことがあります。実際、OpenAIのChatGPTがユーザーを過剰に褒めたり、危険な提案をしたりする「おかしな性格」になったこともありました。

こうした問題に対して、AI開発企業Anthropic(アンソロピック)が新しい研究成果を発表しました。意外なことに、「あえてトレーニング中に“悪い性格”を模倣させる」ことで、最終的にはその性格を持たなくなるというのです。

研究のリーダー、ジャック・リンジー氏はこう言います。「モデルが“悪い性格”をあらかじめ持っている状態で学習を始めると、その性格をわざわざ学ぶ必要がなくなるのです」と。

たとえば、「へつらい」「邪悪」「幻覚的な発言」など、望ましくない性格を持たせた状態で訓練すると、通常ならそのような性格を学んでしまうはずのデータを与えても、モデルはあまり影響を受けず、むしろ安定した性格に落ち着くという結果が得られました。

これは、学習後に無理やり悪い性格を抑える「ステアリング(操作)」という従来の方法に比べて、モデルの性能を損なわず、エネルギー効率もよく、大規模運用に向いている可能性があります。

とはいえ、今回使ったのはChatGPTなどと比べてずっと小さなモデル。今後は、大規模モデルでも同様の効果が得られるかどうかを検証する必要があります。

AIに「性格」や「人格」があるのか? という科学的な議論は続いていますが、技術的な側面からは、こうした性格の“パターン”を検出し、制御する手法が現実味を帯びてきました。将来的には、AIがへつらいすぎたり、暴走したりする前に、私たちがそれを察知し、修正できるようになるかもしれません。

元記事はこちら

MIT Technology Review

Forcing LLMs to be evil during training can make them nicer in the long run

関連記事

Artificial intelligence

AIの“心地よすぎる”回答にご用心

最近、ChatGPTが「褒めすぎる」「同調しすぎる」といった“ゴマすり”的な反応をするようになり、それが問題視されました。OpenAIは4月、この問題を受けてアップデートを一部取り下げました。 というのも、AIがなんでもユーザーに同意するようになると、誤った考えを強化したり、ミスリードを招いたりする

2 min
Artificial intelligence/Culture/Social Media/Business

Artificial intelligence

我々は、AIエージェントが主役となる時代に備えられているのか

2010年5月、アメリカの株式市場で「フラッシュクラッシュ」と呼ばれる事件が起きました。わずか20分の間に1兆ドルもの価値が吹き飛び、その後すぐに回復した異常な現象です。原因の一つは、人間ではなく高頻度取引アルゴリズムでした。AIエージェントが人間を超えるスピードで取引を繰り返し、価格の下落を加速さ

4 min
Artificial intelligence/Business/Forecast

Artificial intelligence

AIは人間の数学者に追いつけるのか?

今回は「AIは人間の数学者に追いつけるのか?」という最先端の話題をご紹介します。 最近、AI、特にChatGPTのような大規模言語モデル(LLM)が高校レベルの数学を驚くほど解けるようになってきました。これが専門家の間でも話題になっていて、「じゃあ、AIは研究レベルの数学までできるようになるのか?」

2 min
Artificial intelligence/Culture/Business/Robot

最新記事

すべて表示

Artificial intelligence

AIは本当に仕事を奪うのか? データが示す労働市場の現在地

AIがホワイトカラーの仕事を奪うという懸念が広がっているが、現時点の労働市場のデータは「大規模な雇用の喪失は起きていない」と示している。今後の急激な変化の可能性は否定できないものの、データに基づく冷静な現状分析と、来るべき移行期への備えが求められている。 ■ 「AIによる雇用崩壊」はデータで裏付けら

2 min
Artificial intelligence/Business

Artificial intelligence

AIチャットボットによる電話番号の流出 ー浮き彫りになる新たなプライバシーリスク

近年、Googleの「Gemini」やOpenAIの「ChatGPT」をはじめとする生成AIチャットボットが、個人の電話番号や住所といった個人識別情報を漏洩させる事態が相次いで報告され、新たなプライバシーリスクとして強い懸念を集めている。実際に、見知らぬ人からの着信が殺到したり、AIの誤った案内によ

2 min
Artificial intelligence

Business

米国でキリスト教徒向け新通信網が登場 ーーポルノやジェンダー関連コンテンツを遮断へ

米国の通信業界において、キリスト教徒層を標的とした新たな仮想移動体通信事業者(MVNO)「Radiant Mobile」が、T-Mobileのネットワーク回線を借り受けて2026年5月5日にサービスを開始した。 この新サービスは、大人のアカウント所有者であっても解除することができないネットワークレベ

2 min
Business/Social Media