腾讯AI实验室联合剑桥大学推出大语言模型PandaGPT：支持文本图像音频等跨模态能力

2025-06-10 09:03:58 | 来源: AICG工具箱

6月6日报道丨6月2日，来自英国剑桥大学、日本奈良先端科学技术大学院大学、腾讯AI Lab的多位研究人员们在网上公开发布了通用指令跟随大模型PandaGPT（直译过来就是：熊猫GPT）。

据介绍，PandaGPT可以执行复杂的任务，如生成详细的图像描述、编写受视频启发的故事、回答有关音频的问题。PandaGPT可同时接受多模态输入，并自然地组合它们的语义。

PandaGPT在文本、图像/视频、音频、深度、热度（thermal）和IMU六种模态上展示了跨模态能力，但由于ImageBind提供的共享嵌入空间，它只能使用对齐的图像-文本对进行训练。研究人员希望PandaGPT可以作为构建通用人工智能（AGI）的第一步，它可以像人类一样全面地感知和理解不同形式的输入。

值得强调的是，目前的 PandaGPT 版本只使用了对齐的图像 - 文本数据进行训练，但是继承了 ImageBind 编码器的六种模态理解能力，具备在所有模态之间跨模态能力。在实验中，论文作者展示了 PandaGPT 对不同模态的理解能力，包括基于图像 / 视频的问答，基于图像 / 视频的创意写作，基于视觉和听觉信息的推理等等，下面其中一个例子，PandaGPT可以很好的接合图像+音频来判断一个事物：

上一篇： 抢占应用落地先机：360智脑大模型应用发布会将于6月13日举行 下一篇： 最后一页

热门榜单

1

小冰岛

类型：常用AI

查看

1
小冰岛
常用AI
2

G3D.AI

类型：常用AI

查看

2
G3D.AI
常用AI
3

InteriorAI，ai室内设计

类型：常用AI

查看

3
InteriorAI，ai室内设计
常用AI
4

ChefGPT，根据现有食材推荐食谱

类型：常用AI

查看

4
ChefGPT，根据现有食材推荐食谱
常用AI
5

AnimeAI

类型：常用AI

查看

5
AnimeAI
常用AI
6

Gemsouls，和虚拟人物交友

类型：常用AI

查看

6
Gemsouls，和虚拟人物交友
常用AI
7

Opus，生成游戏、电影、故事

类型：常用AI

查看

7
Opus，生成游戏、电影、故事
常用AI
8

AskNow，向名人提问

类型：常用AI

查看

8
AskNow，向名人提问
常用AI
9

Podcast，人工智能生成的播客

类型：常用AI

查看

9
Podcast，人工智能生成的播客
常用AI
10

CoolAIid

类型：常用AI

查看

10
CoolAIid
常用AI

热门资讯