RrOrange和朋友们 | 周刊资源分享频道 头像

消息来源频道

RrOrange和朋友们 | 周刊资源分享频道

@RrOrangeAndFriends

频道3,319 位成员公开可见0 人在线

📰 本频道官方周刊:https://rrorangeandfriends.de 🤣 分享日常冲浪互联网看到好玩的网站、app应用、资源分享、效率软件工具集等 🤖 AI新内容、AI应用、免费ChatGPT网站、AI搜索引擎等 🥰 分享白嫖内容、ASMR推荐、擦边快乐小视频等 🎮 分享软件资讯(Gemini、Claude、Cline、Roo-Code) 频道导航:https://t.me/RrOrangeAndFriends/280

成员规模3,319 位成员
在线情况0 人在线
消息总数566 条消息
浏览量总数11,958 次浏览

在这个频道里搜索消息……

t.me/RrOrangeAndFriends

#ChatGPT类分享
🐳 DeepSeek V2 体验 & 分析
🔗直达链接
之前频道发布过一条关于DeekSeek V1的时候体验,当时感觉代码能力和GPT3.5 不相上下甚至超过3.5. 这次 DeekSeek V2 发布,拜读了一下论文和看了下其他微信公众号之后得出一些大众可以理解的信息维度:
⭐ 主要特点:
🟠模型规模:DeepSeek-V2 包含 236B 个参数,其中 21B 个参数在每个 token 激活
🟠上下文长度:支持 128K 个 token 的上下文长度
🟠架构创新:采用 Multi-head Latent Attention (MLA) 和 DeepSeekMoE 架构,提高推理效率和训练经济性
🟠性能对比:与 DeepSeek 67B(你可以理解为DeepSeek V1)相比,性能显著提升,训练成本节约42.5%,KV缓存减少93.3%,最大生成吞吐量提升5.76倍
🟠价格:DeekSeek V2的价格达到了国产大模型(排除LLAMA)的最低价格(输入1 元 / 百万 tokens,输出2 元 / 百万 tokens),具体可以见官网、LLM Price
ps. 如果你感兴趣,本文还提到了在线对齐(online alignment)和离线对齐(offline alignment),作者指出,在偏好对齐实验中,在线方法显著优于离线方法,因此他们投入了巨大的努力来实现一个在线RL框架,用于对DeepSeek-V2进行对齐
📬投稿 & 群聊 🔈频道 🔎索引
🔖 相关阅读:
🟠DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
🟠Deepseek-V2技术报告解读!全网最细!