橘橘橘子汁 & 🍊 头像

消息来源频道

橘橘橘子汁 & 🍊

@microblock_pub

频道13,581 位成员公开可见0 人在线

发一些好玩的 现在成 mb 的私人频道了 Links t.me/Rosmontis_Daily t.me/PDChinaNews

成员规模13,581 位成员
在线情况0 人在线
消息总数1,042 条消息
浏览量总数1,360,923 次浏览

在这个频道里搜索消息……

t.me/microblock_pub

技术报告和线上 Playground 都已经做好了,群友可以玩玩看
另外修正了原文一处可能有误导性的地方,详见注释
模型架构确实和我想的差不多(见图)
输入图片时先使用特征提取 Encoder 将图片转化为高维语义向量网格,然后有一个适配器(双层 MLP)将其再对齐到 LLM 的输入空间(即 tokenize 后,经过 embedding 层后的高维语义向量空间)进行自回归推理;输出图片也类似,输入图像被 VQ-VAE 转换为ID,在自回归推理后(视觉生成任务有一个单独的 prediction head),再将其生成的 ID 转化回图片的形式。这方面是统一了 Align before Fuse 那篇论文和 VQ-VAE 的特性到一个模型里面去。
这么说大家可能不太懂,我们用人话来解释一下:
1. 首先,你说的每一个字被模型看到的时候都会变成一个 [1, 1, 4, 5, 1, 4] 这样的一个数组,也许可以说是大模型的母语
2. 而现在我们引入了图片,它一开始被眼睛(SigLIP Encoder)看到的样子是 [a, b, c, d] 这样,可能是大模型的法语
3. 而为了理解这些个语言,它会在颅内理解并形成一个“想法”,把“想法”混在一起,并直接根据这一头“想法”进行推理,产生结果,而这个结果通常也是用“想法”来表示的
4. 有了结果的“想法”过后,无论是图片还是文字,大模型都得再把“想法”重新变成实体,可能是文字,可能是图片。而变成文字的过程他会用电脑键盘(Transformer Decoder & Detokenizer),变成图片则会用画笔(Image Decoder),于是,你就看到大模型嘎嘎输出了
其实对齐方式的多模态输入已经被玩的很明白了,但是图片输入输出一起上还没啥人做,开源方面也就 TokenFlow 和智源的 Emu3,而这几个数据上都被它打爆了...至于没开源也不给用的那几位,4o 啥的,性能怎么样就只有天知道了...也许还是会强一点吧,再怎么说这玩意也只有撑死 7b 的体量
不知道群友对这种内容感觉如何?能不能大概看得懂,以及有没有兴趣看,可以在评论区说说()
最后祝大家除夕快乐 ヾ(≧▽≦*)o~