过去的智能家居设备更多依赖关键词唤醒与固定命令,用户需要学习设备的“语言”才能完成操作。多模态大模型的介入,让设备能够同时处理文字、语音、图像乃至环境传感器数据,从而理解更复杂的用户意图。
例如,当摄像头识别到用户手指向窗帘并说“太亮了”,系统能够结合视觉信息与语义判断,自动调整遮阳帘而不是简单回复“好的”。这种融合感知能力,让智能家居从被动响应转向主动理解场景。