#ChatGPT类分享
🐳 DeepSeek V2 体验 & 分析
🔗直达链接
之前频道发布过一条关于DeekSeek V1的时候体验,当时感觉代码能力和GPT3.5 不相上下甚至超过3.5. 这次 DeekSeek V2 发布,拜读了一下论文和看了下其他微信公众号之后得出一些大众可以理解的信息维度:
⭐ 主要特点:
🟠模型规模:DeepSeek-V2 包含 236B 个参数,其中 21B 个参数在每个 token 激活
🟠上下文长度:支持 128K 个 token 的上下文长度
🟠架构创新:采用 Multi-head Latent Attention (MLA) 和 DeepSeekMoE 架构,提高推理效率和训练经济性
🟠性能对比:与 DeepSeek 67B(你可以理解为DeepSeek V1)相比,性能显著提升,训练成本节约42.5%,KV缓存减少93.3%,最大生成吞吐量提升5.76倍
🟠价格:DeekSeek V2的价格达到了国产大模型(排除LLAMA)的最低价格(输入1 元 / 百万 tokens,输出2 元 / 百万 tokens),具体可以见官网、LLM Price
ps. 如果你感兴趣,本文还提到了在线对齐(online alignment)和离线对齐(offline alignment),作者指出,在偏好对齐实验中,在线方法显著优于离线方法,因此他们投入了巨大的努力来实现一个在线RL框架,用于对DeepSeek-V2进行对齐
📬投稿 & 群聊 🔈频道 🔎索引
🔖 相关阅读:
🟠DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
🟠Deepseek-V2技术报告解读!全网最细!
🐳 DeepSeek V2 体验 & 分析
🔗直达链接
之前频道发布过一条关于DeekSeek V1的时候体验,当时感觉代码能力和GPT3.5 不相上下甚至超过3.5. 这次 DeekSeek V2 发布,拜读了一下论文和看了下其他微信公众号之后得出一些大众可以理解的信息维度:
⭐ 主要特点:
🟠模型规模:DeepSeek-V2 包含 236B 个参数,其中 21B 个参数在每个 token 激活
🟠上下文长度:支持 128K 个 token 的上下文长度
🟠架构创新:采用 Multi-head Latent Attention (MLA) 和 DeepSeekMoE 架构,提高推理效率和训练经济性
🟠性能对比:与 DeepSeek 67B(你可以理解为DeepSeek V1)相比,性能显著提升,训练成本节约42.5%,KV缓存减少93.3%,最大生成吞吐量提升5.76倍
🟠价格:DeekSeek V2的价格达到了国产大模型(排除LLAMA)的最低价格(输入1 元 / 百万 tokens,输出2 元 / 百万 tokens),具体可以见官网、LLM Price
ps. 如果你感兴趣,本文还提到了在线对齐(online alignment)和离线对齐(offline alignment),作者指出,在偏好对齐实验中,在线方法显著优于离线方法,因此他们投入了巨大的努力来实现一个在线RL框架,用于对DeepSeek-V2进行对齐
📬投稿 & 群聊 🔈频道 🔎索引
🔖 相关阅读:
🟠DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
🟠Deepseek-V2技术报告解读!全网最细!