yihong0618 和朋友们的频道 头像

消息来源频道

yihong0618 和朋友们的频道

@hyi0618

频道8,612 位成员公开可见0 人在线

yihong0618 和朋友们的频道

成员规模8,612 位成员
在线情况0 人在线
消息总数10,129 条消息
浏览量总数3,297,173 次浏览

在这个频道里搜索消息……

t.me/hyi0618

visual-base 这个项目另一个启发点的来源是 DeepSeek OCR 这篇论文。里面纠正了一个我一直以来的思维误区,就是文字比图片更省 Token。
实际上从 LLM 的角度,图片 Token 的信息密度可能是文字 Token 信息密度的 10x-20x,那么以此类推视频 Token 的密度可能是文字 Token 的 100x 了。所以看似文字是做了压缩,但可能不仅是有损压缩,压缩完了体积还膨胀了。
而且只是做 LLM 的理解并不需要 4K 120fps 的视频输入,在 visual-base 里默认只有 1fps。按照 DeepSeek OCR 的压缩思路其实还可以进一步做有损压缩,像记忆自然衰退一样继续降分辨率,降帧率,视频存储的体积也不会和想象一样夸张。