2025-04-19 15:17:30 | 来源: 智享导航

近日,谷歌在其 GitHub 页面发布博文介绍一款名为 VLOGGER AI 的新模型,用户只需要输入一张肖像照片和一段音频内容,该模型可以让这些人物“动起来”,富有面部表情地朗读音频内容。

VLOGGER AI 是一种适用于虚拟肖像的多模态 Diffusion 模型,使用 MENTOR 数据库进行训练,该数据库中包含超过 80 万名人物肖像,以及累计超过 2200 小时的影片,从而让 VLOGGER 生成不同种族、不同年龄、不同穿着、不同姿势的肖像影片。

研究人员表示:“和此前的多模态模型相比,VLOGGER AI 的优势在于不需要对每个人进行训练,不依赖于人脸检测和裁剪,可以生成完整的图像(而不仅仅是人脸或嘴唇),并且考虑了广泛的场景(例如可见躯干或不同的主体身份),这些对于正确合成交流的人类至关重要”。

除了将静态人物进行动态转化之外,还可以针对不同语言系统进行口型的转换,比如将一则英语播报的主播转换为西班牙语的口型。这将有助于视频主播将内容注入更多的语言场景。

谷歌的研究团队认为,可以将 VLOGGER 应用于将 AI 聊天机器人具象可视化,比如让机器人拥有可视化的人物躯干,AI 就可以通过语音、手势和眼神交流以自然的方式与人类互动。 VLOGGER 的应用场景包括可以用于学术报告、教育场域和视频旁白等等 AI 数字人的应用领域。
围观项目主页:
https://enriccorona.github.io/vlogger/
热门榜单
360AI搜索
常用AIsharegpt
常用AIGPTs:GPT Builder创建器
常用AIHi Echo — 网易有道
常用AI美图Moki
常用AIPicTech AI
常用AIPhotosonic
常用AIDreamUp
常用AIScribble Diffusion
常用AI热门资讯
讯飞星火大模型V3.5春季上新,长文本长图长语音,生产力实测:你的超级知识助手来了!
12-26有哪些好用的AI工具_AI工具测评使用_
12-31荣耀CEO赵明:荣耀领先三年,很高兴看到苹果追随我们的AI手机发展路线
02-24马斯克突然发布新版Grok-2大模型,牺牲特斯拉资源叫板OpenAI,一手实测来了
12-25夸克AI搜索_夸克最新动态_夸克官方网站
12-26SD3超详细使用教程+效果测评丨附热门模型下载地址
12-26快手AI文生视频大模型【可灵】首发实测:这可能将成为真正意义的第一款「中国版Sora」
12-26体验完腾讯的AI助理应用「腾讯元宝」,完整的公众号内容生态将是它的最强杀手锏
12-26Stable Diffusion 3最新模型测评丨SD3模型ComfyUI流程简单搭建
12-26商汤科技发布「日日新大模型」5.0:直接对标GPT-4 Turbo,全能分析轻松掌握周冠宇F1赛事数据
12-26