实测了下 Gemini 2.0 Flash 最新的图像生成功能,非常令人惊叹,这应该是目前能力最全面的文生图模型了。其亮点在于推理能力,而且推理原生融合在生成过程中,观感自然舒适。可以看到输出的结果是由一个个 block 组成的,文字部分属于推理,图像则基于之前的推理生成,结构非常清晰合理。相比 Deepseek R1 那种一大坨推理 + 一大坨输出的形式,我认为 Gemini 这种是更先进的。如果有 R2, 希望也是这样推理与结果交替出现的形式。
另外,我觉得这也标志着 reasoning 能力已经普及,很快就会成为大模型的标准功能,不再是某一个厂商的壁垒。AI 业界已经形成百花齐放、你追我赶的良性竞争环境,进步速度可以说是日新月异,一个绝活不能当饭吃。
另外,我觉得这也标志着 reasoning 能力已经普及,很快就会成为大模型的标准功能,不再是某一个厂商的壁垒。AI 业界已经形成百花齐放、你追我赶的良性竞争环境,进步速度可以说是日新月异,一个绝活不能当饭吃。