DeepSeek
Deepseek篇--开源技术FlashMLA详解
2 月 24 日,DeepSeek 启动 “开源周”,首个开源的代码库为 FlashMLA。DeepSeek 这种挤牙膏式的宣推手段也是很有意思,看来梁文锋团队不仅仅是技术派,也擅长玩技术流量 IP。 1 FlashMLA 简介 FlashMLA 是由 depseek ai (深度求索)开发的一个开源项目,针对 GPU(例如 H100 或 H800)的高效的 MLA 推断(Inference)解码
Deepseek篇--结合Autogen构建多Agent应用
分享内容 通过打造一款 AI 旅游规划师,通俗易懂、深入浅出的讲清楚 AI 应用的大方向 Agent 智能体 的原理。 无需科学上网,无需付费API,无需编程能力,一小时即可部署、搭建一款复杂的、多代理交互的 AI 智能体 旅游规划师,通过观察它的工作流程,深入连接 AI 智能体的本质和原理。 环境准备 1.本地部署 Autogen Studio 项目地址: 官方文档: 中文文档: 参考《Auto
Deepseek篇--背后核心技术揭秘
探讨 DeepSeek 大模型的核心技术,从公司背景、模型能力、训推成本到核心技术细节进行了全面分析。 一、关于 DeepSeek 公司及其大模型 1.1 公司概况 DeepSeek 2023 年 7 月成立于杭州,是幻方量化旗下的子公司,全称是杭州深度求索人工智能基础技术研究有限公司。 "成立时间才一年多"、"最近推出的 V3 已经能和 OpenAI 的 4o 媲美"、"训练成本不到 600W
Deepseek篇--阿里QwQ-325b性能比肩Deepseek满血版
3月6日 凌晨 3 点,阿里开源发布了新推理模型 QwQ 32B,其参数量为 320 亿,但性能足以比肩 6710 亿参数的 DeepSeek R1 满血版。 千问的推文表示:「这次,我们研究了扩展 RL 的方法,并基于我们的 Qwen2.5 32B 取得了一些令人印象深刻的成果。我们发现 RL 训练可以不断提高性能,尤其是在数学和编码任务上,并且我们观察到 RL 的持续扩展可以帮助中型模型实现与