一个 AI 为什么可以同时看图、听声音和聊天?
能看、听、说的 AI 系统通常组合多种输入表示和输出能力。
从数据、学习到大语言模型,理解 AI 为什么看起来越来越聪明。
共 72 篇文章 · “动手思考” 清除
能看、听、说的 AI 系统通常组合多种输入表示和输出能力。
AI 处理图片时先使用像素等数值表示,再通过模型提取和组合信息。
图像分类模型通过训练学习与类别相关的视觉模式。
训练系统可以通过目标和损失函数计算误差。
语音转文字用模型把音频映射成文本。
声音模型处理随时间变化的音频信号。
图片理解把视觉线索与任务联系起来,但无法可靠知道照片之外的一切。
语音系统把声音转成可计算的数据,再用模型识别或处理语言。
视频理解需要处理画面随时间的变化,可能还结合音频。