我想做一个几乎不需要点击的网页。
进入页面以后,用户面对的不是按钮、菜单或输入框,而是一张脸、一个场景,或者某种还没有固定形态的数字生命体。摄像头开始捕捉人的面部表情、身体动作和与屏幕之间的距离。系统根据这些变化,实时改变画面中的形态、空间、声音和节奏。
在这个过程中,人并不是通过明确指令来控制系统。人的脸、动作、停顿和观看本身,就是输入。
这构成了这个项目最基本的问题:如果表情本身可以成为一种界面,那么人与数字系统之间的关系会发生什么变化?
从“操作界面”转向“感知界面”
大多数数字产品都要求用户主动发出命令。点击一个按钮,系统执行一个操作;输入一段文字,系统返回一个结果;拖动一个滑块,界面产生对应变化。
这种关系非常清楚。用户知道自己做了什么,也大致知道系统为什么响应。
但人的真实状态并不总是通过明确指令表达出来。
一个人可能皱眉,但没有想要“提交”皱眉;他可能突然靠近屏幕,也可能长时间保持沉默;他可能笑了一下,但这个笑并不一定代表高兴。很多身体和情绪信号本来就是连续的、模糊的,甚至彼此矛盾。
我想尝试建立一种不同的交互逻辑:系统不再等待明确命令,而是持续感知人的状态,并用一个不断变化的数字环境进行回应。
这里的“界面”不再只是屏幕上的控件,而是人的身体本身。
不把情绪当成一个标签
这个项目很容易被理解成“情绪识别”。
但我并不希望它变成一个判断“你现在是开心、悲伤还是愤怒”的系统。
这样的判断过于简单。
人的情绪很难被压缩成几个固定标签。同一个表情可能出现在完全不同的心理状态中。微笑可能来自愉快,也可能来自紧张、礼貌或不适。一个人没有明显表情,也不意味着他没有情绪。
因此,这个项目更关心的不是“识别正确”,而是“系统如何解释”。
摄像头捕捉到的面部变化、视线、身体姿态和运动强度,可以被转化为一组连续信号。这些信号不需要对应一个确定的心理结论,而可以直接影响生成系统。
例如,身体运动速度可能影响画面的流动强度;面部变化的幅度可能影响三维形态的变形程度;人与摄像头的距离可能改变空间的深度;长时间的静止可能让音乐和视觉逐渐变得稀疏。
这样,系统不必说“你现在很焦虑”。
它只是创造一个与当前状态有关的环境。
一个会回应你的空间
我更愿意把这个作品理解成一个“情绪生成空间”,而不是一个识别工具。
用户进入网页以后,首先看到的可能是一个相对稳定的场景。随着摄像头开始读取人的状态,这个场景逐渐发生变化。
变化可以很具体,也可以非常抽象。
一张三维面孔可能随着用户的表情发生细微变形。
一个粒子空间可能因为人的动作而聚集或扩散。
光线可能随着人的距离发生变化。
声音可以从一个持续的背景层开始,慢慢增加新的音色、噪声或节奏。
某些变化可以非常快速,直接对应一个动作;另一些变化则可以具有记忆,在一段时间内累积。
这样,用户面对的就不再是一个简单的反馈系统。
它更像一个会被人的存在逐渐改变的空间。
反馈不一定需要“正确”
传统交互设计非常强调反馈的准确性。
用户点击一个按钮,系统应该给出明确反馈。如果系统理解错误,就会被认为是一个设计问题。
但在这个项目中,我反而对“误读”感兴趣。
如果一个人皱眉,系统生成了一个非常柔和的空间;如果一个人微笑,画面却开始变得紧张,这种不一致本身也可能构成体验。
因为人的表情与人的内部状态之间,本来就不存在完全透明的对应关系。
机器对人的理解同样如此。
这使系统不再像一个忠实的镜子,而更像一个有偏差的翻译器。
它看到一个表情,然后把这个表情转换成自己的视觉和声音语言。这个转换可能接近人的感受,也可能完全偏离。
这种偏离让我觉得有意思。
因为它暴露了一个问题:当机器说它“理解”我们时,它到底理解了什么?
被观看与观看
摄像头让这个项目天然包含另一层关系。
用户在看屏幕,而屏幕背后的系统也在看用户。
这种双向观看和普通网页体验不同。
当用户意识到自己的脸正在影响画面,他可能会主动改变表情。
他可能开始尝试笑、皱眉、闭眼、靠近或离开。
此时,表情就发生了变化。
最开始,表情只是自然状态;随后,它变成一种试探;再之后,它甚至可能变成一种表演。
用户会开始思考:“如果我这样做,它会发生什么?”
系统也由此改变了人的行为。
这意味着交互不是单向的。
不是“人的情绪影响系统”这么简单,而是一个循环:
人影响系统,系统产生反馈,反馈又影响人的下一次表情和动作。
如果这个循环持续足够久,最后出现的状态可能已经无法明确区分,是人的情绪产生了画面,还是画面产生了人的情绪。
我认为这个循环可能是整个项目最重要的部分之一。
情绪作为一种材料
在视觉艺术中,我们习惯把颜色、形状、声音、文字和空间看作材料。
我想进一步提出一个问题:人的情绪状态是否也可以成为材料?
这里的“材料”不是说要把人的情绪保存下来,或者把它变成一个可以被量化的对象。
我更关心的是,它是否可以参与作品的生成过程。
人的一个微小动作,可以改变空间。
一段持续的凝视,可以改变声音。
身体的靠近或离开,可以改变一个虚拟物体的状态。
在这种关系中,作品并不是在用户进入之前就已经完成。
它只能在用户出现以后成立。
每一次访问也可能产生不同结果。
作品的最终形态不是一个固定画面,而是人与系统共同产生的一段过程。
技术只是中介
从实现上看,这个项目可能涉及几个不同系统。
网页需要访问摄像头输入。
系统需要分析面部特征、身体姿态或画面中的运动。
这些数据随后可以进入一个实时生成系统,驱动三维模型、粒子、光线、着色器(shader)、动画或其他视觉元素。
声音部分也可以由同一组数据控制,通过程序化声音、环境音层或音乐结构产生变化。
这些技术都很重要。
但我不希望项目最终变成一次技术能力展示。
面部追踪、三维生成和声音合成本身都不是作品的目的。
它们只是建立关系的中介。
真正的问题仍然是:当一个数字系统开始持续感知一个人的身体,并且不断根据这种感知改变环境时,人会如何理解自己和这个系统之间的关系?
从“理解人”转向“回应人”
我觉得这个项目有一个很重要的区别。
它不一定需要理解人。
它只需要回应人。
“理解”意味着系统似乎知道用户真实的心理状态。
这实际上是一个很强的判断。
而“回应”更加开放。
系统接收到一个变化,然后产生另一个变化。
它不宣称自己知道人的真实情绪。
它只建立一种映射关系。
这种映射可以是柔和的,也可以是矛盾的;可以稳定,也可以逐渐失控;可以让用户感到被理解,也可以让用户意识到自己正在被一个并不了解自己的系统持续解释。
这种不确定性不是项目需要消除的问题。
它可能恰恰是作品的一部分。
一个不稳定的数字镜子
如果要用一个简单的比喻描述这个作品,我会把它看作一面不稳定的镜子。
普通镜子只是反射人的外表。
这个系统却会重新解释它看到的东西。
你皱眉,它不会复制你的皱眉,而可能让空间收缩。
你靠近,它可能让声音远离。
你突然笑,它可能让一个虚拟物体开始分裂。
它不断接收你的状态,但从不完全复制你。
因此,它既像镜子,又不像镜子。
你能在里面发现自己的痕迹,但无法完全控制这些痕迹最后会变成什么。
我希望这种体验能产生一种很微妙的感觉。
一方面,用户会觉得这个空间与自己有关。
另一方面,他又无法确定系统究竟如何看待自己。
这种距离可能比一个“准确识别情绪”的系统更有意义。
我真正想研究的问题
最终,这个项目并不是关于如何制造一个更聪明的表情识别程序。
它更接近几个开放的问题。
当人的身体本身成为界面以后,交互还需要明确的命令吗?
当机器不断读取人的面孔时,这种感知是一种理解,还是一种解释?
当系统的回应开始影响人的下一次表情时,到底是谁在控制谁?
一个数字空间是否可以不以信息传递为主要目标,而以氛围、感觉和反馈循环为核心?
以及,当人的情绪进入一个实时生成系统以后,它是否可以成为一种新的创作材料?
我现在还不知道这个作品最终应该是一张脸、一个房间、一个抽象空间,还是一个没有明确物种的数字生命体。
我也不认为现在就需要决定。
对我来说,更重要的是先建立这种关系:
一个人站在屏幕前。
系统看见他。
他看见系统的回应。
然后,他因为这个回应发生一点变化。
系统再次看见这个变化。
这个循环不断继续。
作品就在这个循环中发生。