我想做一个几乎不需要点击的网页。
进入页面以后,用户面对的不是按钮、菜单或输入框,而是一张脸、一个场景,或者某种还没有固定形态的数字生命体。摄像头捕捉面部变化、身体动作,以及人与屏幕之间的距离。系统根据这些可见信号,实时调整画面形态、空间、声音和节奏。
在这个过程中,人并不主要通过明确指令控制系统。脸上的变化、动作、停顿和观看本身,都可以成为输入。
这个项目由此提出了一个基本问题:如果表情本身可以成为一种界面,那么人与数字系统之间的关系会发生什么变化?
从“操作界面”转向“感知界面”
大多数数字产品都要求用户主动发出命令。点击一个按钮,系统执行一个操作;输入一段文字,系统返回一个结果;拖动一个滑块,界面产生对应变化。
这种关系非常清楚。用户知道自己做了什么,也大致知道系统为什么响应。
但人的许多身体状态并不会以明确指令的形式出现。
一个人可能皱眉,但没有想要“提交”皱眉;他可能突然靠近屏幕,也可能长时间保持沉默;他可能笑了一下,但这个笑并不一定代表高兴。很多身体和情绪信号本来就是连续的、模糊的,甚至彼此矛盾。
我想尝试建立一种不同的交互逻辑:系统持续读取这些可见信号,让数字环境随之变化,而不再等待用户先发出明确命令。
在这种交互里,“界面”不再只存在于屏幕上的控件中,人的身体也成为界面的一部分。
不把情绪当成一个标签
这个项目很容易被理解成“情绪识别”。
但我并不希望它变成一个判断“你现在是开心、悲伤还是愤怒”的系统。这样的判断过于简单。
人的情绪很难被压缩成几个固定标签。同一个表情可能出现在完全不同的心理状态中。微笑可能来自愉快,也可能来自紧张、礼貌或不适。一个人没有明显表情,也不意味着他没有情绪。
这个项目更关心的不是“有没有识别出正确情绪”,而是系统怎样把这些信号转化为回应。
摄像头捕捉到的面部变化、视线、身体姿态和运动强度,可以被转化为一组连续信号。系统无须先声称自己知道用户的心理状态,就可以直接让这些信号参与内容生成。
例如,身体运动速度可能影响画面的流动强度;面部变化的幅度可能影响三维形态的变形程度;人与摄像头的距离可能改变空间的深度;长时间的静止可能让音乐和画面中的元素逐渐变得稀疏。
这样,系统不必说“你现在很焦虑”,只需要创造一个与当前这些信号有关、但不必与任何情绪标签一一对应的环境。
一个会回应你的空间
我更愿意把这个作品理解成一个“情绪生成空间”,而不是一个识别工具。
用户进入网页以后,首先看到的可能是一个相对稳定的场景。随着摄像头开始读取人的状态,这个场景逐渐发生变化。
变化可以很具体,也可以非常抽象。
一张三维面孔可能随着用户的表情发生细微变形。
一个粒子空间可能因为人的动作而聚集或扩散。
光线可能随着人与屏幕之间的距离变化。
声音可以从持续的背景音开始,慢慢加入新的音色、噪声或节奏。
某些变化可以非常快速,直接对应一个动作;另一些变化则可以保留此前动作的影响,在一段时间内逐渐累积。
这样,用户面对的就不再是一个简单的反馈系统,而更像一个因人的存在而逐渐改变的空间。
反馈不一定需要“正确”
很多操作型界面强调操作与反馈的一致性。用户点击一个按钮,系统应该让人清楚知道发生了什么;如果按钮产生了完全无关的结果,通常就是设计问题。
但这个作品并不试图建立这种一一对应的控制关系。我反而对“误读”感兴趣。
如果一个人皱眉,系统生成了一个非常柔和的空间;如果一个人微笑,画面却开始变得紧张,这种不一致本身也可能成为体验的一部分。
人的表情本来就不能直接、完整地等同于内心状态,系统从这些表情得到的也只是有限信号。这使它不再像一个忠实的镜子,而更像一个带着自身规则的翻译器。
它看到一个表情,然后把这个表情转换成自己的视觉和声音语言。这个转换可能接近人的感受,也可能完全偏离。
我对这种偏离感兴趣,因为它引出了一个问题:当机器说它“理解”我们时,它到底理解了什么?
被观看与观看
摄像头让这个项目天然包含另一层关系。
用户在看屏幕,而屏幕背后的系统也在持续读取用户。
这种双向观看和普通网页体验不同。它也意味着摄像头不能只是一个被默默打开的传感器:用户应该知道系统读取什么、是否保存、在哪里处理,并能够拒绝或停止这种观看。数据边界不仅是隐私要求,也会直接影响作品中的“被观看”究竟是一种自愿参与,还是一种无法退出的监视。
当用户意识到自己的脸正在影响画面,他可能会主动改变表情,开始尝试笑、皱眉、闭眼、靠近或离开。
此时,表情的作用也变了。
最开始,表情只是自然状态;随后,它变成一种试探;再之后,它甚至可能变成一种表演。
用户会开始思考:“如果我这样做,它会发生什么?”
系统也由此改变了人的行为。
交互并非单向的“人的情绪影响系统”,而是一个循环:
人影响系统,系统产生反馈,反馈又影响人的下一次表情和动作。
如果这个循环持续足够久,就很难再把因果关系写成单向箭头:人的表情和动作改变画面,画面又继续影响人的下一次反应。
这个反馈循环可能是整个项目最重要的部分之一。
情绪作为一种材料
在视觉艺术中,我们习惯把颜色、形状、声音、文字和空间看作材料。
我想进一步提出一个问题:情绪在身体上留下的痕迹,是否也可以成为创作材料?
这里的“材料”并不是人的真实情绪本身,更不是把情绪保存成一个可量化对象。我指的是那些能够被系统感知的外在变化,以及这些变化如何参与作品的生成过程。
人的一个微小动作,可以改变空间。
一段持续的凝视,可以改变声音。
身体的靠近或离开,可以改变一个虚拟物体的状态。
在这种关系中,作品在用户进入之前只有一套生成条件,具体形态要到互动发生以后才出现。每一次访问都可能得到不同结果。
作品最终呈现的不是一幅固定画面,而是一段人与系统共同形成的过程。
技术只是中介
要实现这个项目,需要把感知和生成两部分连接起来。网页首先取得经过用户授权的摄像头输入,再从画面中提取面部变化、身体姿态、运动强度或距离等信号。这些信号进入实时生成系统以后,可以驱动三维模型、粒子、光线、着色器(shader)和动画,也可以控制程序化声音、环境音层或音乐结构。
这些技术都很重要,但我不希望项目最终变成一次技术能力展示。
面部追踪、三维生成和声音合成本身都不是作品的目的,而是连接人与数字环境的中介。
我更关心的是:当一个数字系统开始持续感知一个人的身体,并不断根据这种感知改变环境时,人会如何理解自己和这个系统之间的关系?
从“理解人”转向“回应人”
对这个项目来说,我觉得有必要区分“理解”和“回应”。这里所谓“理解”,指的是系统声称能够从外在信号推断用户真实的心理状态;这样的主张需要远强于表情追踪本身的证据。
“回应”则没有这个前提。系统接收到一个变化,再产生另一个变化。它建立的是一种可感知的映射关系,而不是对人的真实情绪作出诊断。
这种映射可以是柔和的,也可以是矛盾的;可以稳定,也可以逐渐失控;可以让用户感到被理解,也可以让用户意识到自己正在被一个并不了解自己的系统持续解释。
这种不确定性可能恰恰是作品的一部分,无须把它当成必须消除的问题。
一个不稳定的数字镜子
如果要用一个简单的比喻描述这个作品,我会把它看作一面不稳定的镜子。
普通镜子只是反射人的外表。
这个系统却会重新解释它看到的东西。
你皱眉,它不会复制你的皱眉,而可能让空间收缩。
你靠近,它可能让声音远离。
你突然笑,它可能让一个虚拟物体开始分裂。
它不断接收你的状态,但从不完全复制你。
它既像镜子,又不像镜子。
你能在里面发现自己的痕迹,但无法完全控制这些痕迹最后会变成什么。
我希望这种体验带来一种微妙的感觉:用户觉得这个空间与自己有关,却又无法确定系统究竟如何看待自己。
这种距离可能比追求一个看似“准确识别情绪”的系统更接近这个作品真正关心的问题。
我想研究的问题
这个项目最终想探索的是一组开放问题,而不是做出一个更聪明的表情识别程序。
当人的身体本身成为界面以后,交互还需要明确的命令吗?
当机器不断读取人的面孔时,这种感知是一种理解,还是一种解释?
当系统的回应开始影响人的下一次表情时,到底是谁在控制谁?
一个数字空间是否可以不以信息传递为主要目标,而以氛围、感觉和反馈循环为核心?
以及,当人的情绪进入一个实时生成系统以后,它是否可以成为一种新的创作材料?
我现在还不知道这个作品最终应该是一张脸、一个房间、一个抽象空间,还是一个没有明确物种的数字生命体。
我也不认为现在就需要决定。
对我来说,更重要的是先建立这种关系:
一个人站在屏幕前。
系统看见他。
他看见系统的回应。
然后,他因为这个回应发生一点变化。
系统再次看见这个变化。
这个循环不断继续。
作品就在这个循环中发生。