visual-base 这个项目另一个启发点的来源是 DeepSeek OCR 这篇论文。里面纠正了一个我一直以来的思维误区,就是文字比图片更省 Token。
实际上从 LLM 的角度,图片 Token 的信息密度可能是文字 Token 信息密度的 10x-20x,那么以此类推视频 Token 的密度可能是文字 Token 的 100x 了。所以看似文字是做了压缩,但可能不仅是有损压缩,压缩完了体积还膨胀了。
而且只是做 LLM 的理解并不需要 4K 120fps 的视频输入,在 visual-base 里默认只有 1fps。按照 DeepSeek OCR 的压缩思路其实还可以进一步做有损压缩,像记忆自然衰退一样继续降分辨率,降帧率,视频存储的体积也不会和想象一样夸张。
实际上从 LLM 的角度,图片 Token 的信息密度可能是文字 Token 信息密度的 10x-20x,那么以此类推视频 Token 的密度可能是文字 Token 的 100x 了。所以看似文字是做了压缩,但可能不仅是有损压缩,压缩完了体积还膨胀了。
而且只是做 LLM 的理解并不需要 4K 120fps 的视频输入,在 visual-base 里默认只有 1fps。按照 DeepSeek OCR 的压缩思路其实还可以进一步做有损压缩,像记忆自然衰退一样继续降分辨率,降帧率,视频存储的体积也不会和想象一样夸张。