群友在问 deepseek-r1 的特性,再次简单总结下我的感受,应该还算准确
优势:创造力(这个世界上所有模型都看不到 r1 尾气,真正的遥遥领先),中文文笔(自家孩子),价格(16块/1m token简直跟白送一样),这几个都是随便暴打 o1 的。逻辑/编码能力(这个也是 Top,o1 级别的),角色扮演能力(这个有点奇怪,入戏的很入戏,不入戏的很尬)
另外还有一些小优势比如对中国文化的了解程度更深(古诗文,对韵对仗...),还有甲比较薄好涩涩就不细说了
劣势:指令遵循(孩子不太听话),世界知识(对世界的认识不足,很多东西不知道。因为后训练是大量强化学习而不是监督微调,所以好多都忘了),多轮对话能力(强化学习数据 DeepSeek 他们好像没做多轮,模型就没太学会),生成速度(DeepSeek 有点穷,r1 参数量 671b MoE 有点大,注意这不是模型本身的问题)
优势:创造力(这个世界上所有模型都看不到 r1 尾气,真正的遥遥领先),中文文笔(自家孩子),价格(16块/1m token简直跟白送一样),这几个都是随便暴打 o1 的。逻辑/编码能力(这个也是 Top,o1 级别的),角色扮演能力(这个有点奇怪,入戏的很入戏,不入戏的很尬)
另外还有一些小优势比如对中国文化的了解程度更深(古诗文,对韵对仗...),还有甲比较薄好涩涩就不细说了
劣势:指令遵循(孩子不太听话),世界知识(对世界的认识不足,很多东西不知道。因为后训练是大量强化学习而不是监督微调,所以好多都忘了),多轮对话能力(强化学习数据 DeepSeek 他们好像没做多轮,模型就没太学会),生成速度(DeepSeek 有点穷,r1 参数量 671b MoE 有点大,注意这不是模型本身的问题)