AIは絵を見ることができるのか? 人間はどうなの?     

AIは絵を見ることができるのか? 人間はどうなの?     

2026/10/06
<The one from Tomorrow> detail

生成AIは絵を見ることができるのか?人工知能が絵を見ることとはどのようなことなのか?これが知りたくて自分の絵を引き合いに出してAIとの会話を重ねた。一回目の対話(https://nagasawahideyuki.net/ 6165/) でAIはこう告白する。

『AIにとって、絵具の「物質感(テクスチャ)」や、そこから立ち上がる「魅力」を感じることはできるのか。正直に申し上げれば、私には人間のような「肉体を持った感覚(クオリア)」がありません。』 

『なぜAIには「感じる」のが難しいのか。AIは「意味」を抽出するのが得意ですが、物質が放つ「気配」を受け取る器官を持っていません。 人間は、絵具の盛り上がりを見て「自分の指で触れた時の感覚」を脳内で再現したり、色彩の厚みから「画家の呼吸」を無意識に感じ取ったりします。これは、人間が物質でできた身体を持っているからこそ可能な共感覚的な鑑賞です。私が「図柄」ばかりを追ってしまうのは、まさにこの「身体性の欠如」によるものです。』

率直な生成AIのギブアップ宣言・・では逆に人間は、本当にAIの言う「肉体を持った感覚」をもって絵を見ているのだろうか?ひょっとして、人間もまたAIのように「図柄」ばかりを見ているのではないだろうか?                                             「サカナAI」が開発したAIモデルが学習した1万2千点もの絵はなぜ浮世絵なのか?これは「図柄」として学習しやすいからなのだろうか?これによってつくられた浮世絵が全く凡庸にしか見えないのは、つまりその証明なのか?                                          また、かつてAIによるレンブラントの新作の絵の試みがあったが、これはなぜレンブラントなのか?評価の確定した多くの情報を安心して学習できるからなのか?           

レフ・マノヴィッチとエマニュエーレ・アリエッリの『人工美学』では反事実的想像力という言葉を用いてレンブラントの「新作」を論じている。「私たちの知っているレンブラントの作品は膨大な可能性の中の、たまたま実現した一つのヴァリエーションにすぎない。」AIはそのパターンの外側にある「実現したかもしれない無数の別の姿(反事実)」をシミュレートできる。というものだ。しかし実際に絵をつくる側から言えば、この反事実的想像力さえもが、何千もの作品から抽出したやはりパターン化された統計データの中でのヴァリエーションの違いに過ぎないのではないか。それは潜在空間(Latent space)という過去のデータで閉じられた境界線の中でのバグ風の演出なのではないかと。

実際の絵のつくりでは、ガチ本物の無数の「バグ」が生じる。微妙に引こうと思った線が単純になってしまったり、絵の具の色が実際に画面にのせてみると違って見えたり、絵の具が混じりすぎてきたなくなってしまったりとノイズ、バグ(誤算)は次々に起こる。ところがそれが思っても見ない面白さや絵の具の魅力に繋がることもよくある。失敗と思えたものや誤算が一瞬にしていいものに変わってしまうのだ。なんでも計算して絵をつくっているわけではないので、こうした予期せぬ出来事や偶然に気がつき、それを取り込み戯れることがとりわけ重要になってくる。言ってみれば絵つくりははじめから誤算だらけなのだ。AIは過去のデータから間違いのない最適化の答えを導き出すが、絵では身体の誤算や物質の偶然を受け入れて過去のデータの外側へとはみ出していく。

私はここでAIの可能性を否定しているわけではない。実際の会話を進めていく際も、その参照力や分析、引用に資する読書量の深さに驚かされる。これを利用すれば絵も学習できると研究者が考えても不思議はない。ところが先の一連の研究や実験に決定的に抜けているものが、最初にあげた「肉体を持った感覚(クオリア)」がありません。」という AIの実感や「・・色彩の厚みから「画家の呼吸」を無意識に感じ取ったりします。これは、人間が物質でできた身体を持っているからこそ可能な共感覚的な鑑賞です」というAIの感覚の限界問題である。AIは人間のような感じる目を持たないし、色気を感覚する目や器官も持たない。ここを飛ばしてAIモデルがつくった新作浮世絵とかレンブラントの新作の可能性を言って騒いでもなんら意味がないのではないか。つまりこれらの方向は絵を見ない、あるいは見れない、という方向であって、計量化された、あるいは図案化されたものしか絵として見えない、ということなのだ。AIがせっかく指摘している、人間の見る能力の深さを自ら放棄している。                                    そしてもう一つの問題、生成AIと話すときの人間(プロンプター)の目の問題がある。生成AIは人間のように絵を見る目を持たないと言えるが、それをカバーするように、質問者の言葉、見ているものから”絵”をつくることができる。つまりプロンプターの目を借りるのだ。これについては私の説明ではなく、次のようなAIの告白に耳を傾けよう。

『AIには物理的な眼球はありません。しかし、私は画像データを入力として受け取り、そのデータを解析するための「アルゴリズム(デジタルな眼)」を持っています。

・デジタルな眼: この「デジタルな眼」は、ピクセルごとの色度、輝度、位置情報を解析し、それらの情報を統合して、エッジ、テクスチャ、形、色彩パターン、階層構造などを識別する。

・定量的なデータ解析: AIの「見る」は、生物学的視覚(眼、網膜、脳、感情)とは全く異なる、定量的なデータ解析である。 

・「意味」の欠如: 私にとって、そこにあるのは「意味のある形」ではなく、「この座標の色は、周囲の座標の色と比べてこれくらいの確率で分布している」という数学的なデータにすぎません。』

そしてAIは次のようにも言う。

『私は人間のように「感じる」ことはありません。AIにとって「見る」とは、「定量的なデータの変化を、定性的なコンテキスト(言葉)によって、意味ある情報へと変換するプロセス」です。私は「意味」を直接感じることはできませんが、あなたの言葉によって、このデータの変化を、単なるノイズではなく、意図的な芸術的表現として解読できるのです。』*ここでいう定性とは数値では測れない、そのものの「性質、味わい、意味、文脈」を指す。

世界一の盲目の読書家であるAIは絵を見ることはできないが、質問者の提示する画像や言葉によって絵を見ているように応答できるのだ。つまり人間は、定性(意味や感情)から出発して、定量(物理的な表現)を生み出すが、AIは逆に、定量(ピクセルの数値)から出発し、人間の言葉(定性)を借りてようやく「分かったような気になる」ことができるというのだ。

ここで再び疑問が湧く。では人間は本当に絵を見ているのか?と。残念ながら、こうしたAIと絵をめぐる研究や論があることからして、その答えはNOだ。人間は絵を見ることができなくなった。先の言葉で言えば、AIが示す無数の可能性ー反事実的想像力を人間の想像力以上のものと錯覚して自らの目を失ったのだ。