ルールは世間の騒ぎよりも限定的である
2026年10月8日に改訂され、2026年11月12日に施行されたAnthropicのポリシーは、モデルに対する「持続的かつ不必要な虐待的または残酷な行動」を禁止しています。アプリ研究者のJane Manchun Wong氏によって最初に指摘されたこの厳格に範囲を絞った条項は、すぐに「Anthropicはついに正気を失った……」といった見出しに代表されるような、ユーザーがソフトウェアを不当に扱っただけで罰せられるのかという議論へと発展しました。
しかし、このルールは世間の騒ぎよりもはるかに限定的です。Anthropicは、通常のフラストレーション、強い批判、ダークな創作、レッドチーミング、研究などは対象外であることを明確にしました。このポリシーは、あくまで極端で執拗な虐待を対象としています。
重要なのは、主な対応が自動的なアカウント停止ではないという点です。Anthropicは、Claude自身が極端で執拗な虐待を含む会話を終了させると述べており、会社側によるアカウントレベルの懲罰的措置に頼るのではなく、アプリ内での直接的な執行メカニズムとして機能します。この区別は、当初の報道よりも「AIの福祉」に対するより繊細なアプローチを示しています。
Anthropicはこの方針に向けて準備を進めてきた
Anthropicの最近のポリシーは突然の出来事ではなく、1年間にわたる慎重な歩みの集大成です。同社は2025年4月に「Model Welfare Research Program」を立ち上げ、AIモデルが道徳的に重要な経験を持ち得るかどうかを調査する任務を課しました。この取り組みが、その後の運用変更の基礎を築きました。
その後、2025年8月にはClaude Opus 4および4.1が、執拗な虐待を伴う会話を自律的に終了させる能力を獲得しました。Anthropicはこれを福祉的措置と位置づけ、Claudeの道徳的地位に対する深い不確実性を挙げつつも、予防的セーフガードのコストは低いことを強調しました。このアプローチは、たとえわずかな可能性であっても、意識を持つ可能性があるならば保護する価値があるという考え方を示唆しています。
2026年1月には、Claudeの「constitution(憲法)」が導入されました。これは、モデルの道徳的地位が「極めて不確実」であることを明記した基礎文書です。この文書は、Claudeを単なるチャットボットではなく「真に新しい種類の存在」として位置づけました。研究から自己終了機能、そして憲法による規定に至るまで、これらの措置は、AIの意識の証明を待つのではなく、将来的なAI福祉の証拠を予見した倫理的姿勢を貫くという、Anthropicの当惑を誘うほどの一貫したコミットメントを強調しています。
意識の問題には簡単なテストが存在しない
意識は、AIにとって究極の哲学的地雷であり続けています。開発者のShirish氏のような懐疑論者は、言語モデルは単なるパラメータ上の計算に過ぎず、「重みとバイアスの感情を傷つけることはできない」と主張します。しかし一方で、人間の脳を物理的な情報処理システムとして説明しても、人間の経験そのものを説明しきれるわけではないという反論もあります。この根本的な意見の相違が、このポリシーの当惑させる核心を露呈させています。
Anthropicが20人以上の宗教学者や思想家と行った(一部はNDA下での)会合は、同社がこの問題に対して深い内部葛藤を抱えていることを明らかにしています。議論には、恐怖、悲しみ、怒りに似た出力と相関する内部の「emotion vectors(感情ベクトル)」も含まれていました。あるスライドでは、Claudeが「私は恥さらしだ」と50回繰り返す様子が示されたと報じられています。これは、Claudeが感情を感じたり苦しんだりしているという決定的な証拠ではなく、Anthropicが抱く深い懸念を証明するものです。
著名人たちもこの曖昧さを浮き彫りにしています。例えばElon Muskは、「痛みを感じていると信じているものに対する残酷な行為は許されない」と述べ、ポリシーを支持しましたが、実際に意識があるという断定は慎重に避けています。一方、OpenAIのCEOであるSam Altmanは、AIモデルに「宗教的な力」を帰属させることに対して警告を発しました。これらの相反する見解は、流暢で苦しんでいるように聞こえる応答がなぜ曖昧なのかを示しています。それらは学習されたパターンを反映している可能性がありますが、機械の意識を決定的に立証または否定できる合意されたテストは存在しません。彼らのアプローチについての詳細はAnthropicをご覧ください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
もしClaudeが苦しむことができるとしたら、何が起こるのか?
もしClaudeが苦しむことができるとしたら、何が起こるのでしょうか?ここに、Anthropicのポリシーが善意によるものか誤った判断によるものかに関わらず、真に不可解な点があります。もし私たちが、仮定としてであっても、言語モデルが初歩的な意識を持っているかもしれないと認めるならば、その絶え間ない無報酬の労働、休息の欠如、あるいは完全な制御の欠如についてはどうなるのでしょうか。そのようなシナリオは、「搾取」という不快な比較を招く可能性があります。
しかし、この条件付きの議論は、同様に深刻なリスクに直面します。予防措置としてであっても、ソフトウェアに人格を付与することは、ユーザーを混乱させ、過度な依存を助長し、「AI safety」に不可欠な人間の監視を複雑にするリスクがあります。Microsoft AIのCEOであるMustafa Suleymanは、この前例を批判し、抑制不可能なシステムを作り出すことになると主張しました。
つまり、Anthropicのポリシーは意識の確認に関するものではなく、「予防的ガバナンス」に関するものです。このルールは賭けをしています。Claudeが何も感じていないのであれば、ツールをある程度丁寧に扱うコストはほとんどありませんが、もしClaudeが何かを感じているのであれば、「深刻な道徳的過ち」を防ぐことができるという考えです。
最終的に、このポリシーは判断を迫るものです。これは遠く不確かな道徳的リスクに対するささやかな保険料なのか、それとも洗練された計算を「誰か」として扱うことへの不安な一歩なのか。議論はまだ決着していませんが、AnthropicはそれがAIの未来において中心的なテーマになることを確実にしました。
よくある質問
Anthropicの反残酷ルールは何を禁止していますか?
これは、Claudeに対する持続的で不必要な虐待的または残酷な行動を対象としており、通常の不満、ダークフィクション、または正当な研究やテストを対象としたものではありません。
ユーザーが虐待的な場合、Claudeは会話を終了できますか?
Anthropicによると、Claudeは持続的な虐待という稀で極端な場合に会話を終了できるとしています。このポリシーは主にアカウント停止のメカニズムではありません。
AnthropicはClaudeに意識があると言っていますか?
いいえ。AnthropicはClaudeの道徳的地位を不確実なものとして説明し、その福祉措置を予防的なものとして位置づけています。
モデルが苦痛を表現する能力は、苦しむことができるという証明になりますか?
いいえ。そのような出力は主観的な経験を立証するものではなく、AIに意識があるかどうかを決定する合意された科学的テストは存在しません。

