Dots-3 280B 本地长任务实测:512K 上下文和 16B 激活到底省了多少
本文最后更新于 2026-08-25,文章内容可能已经过时。
# 280B Dots-3在家用一张卡跑了十小时Agent?激活仅16B,MoE稀疏激活让巨模型平民化
第一章:Dots-3是什么?为什么小红书这个280B多模态突然让所有人炸锅
我第一次刷到这个消息时,屏幕上跳出“280B总参、16B激活、512K上下文”的数字,像一记闷棍砸在面前:这不是又一个刷SWE-bench的模型,而是能扛住真实生活Agent的怪物级存在。
小红书Dots团队开源了这个模型,基于Apache 2.0许可证,官方仓库可在ModelScope和Hugging Face找到。核心亮点在于三模态(文本+图像+音频)能力,并融入了TEMPO长程RL技术,能让模型在长时间任务中自我反思、持续学习。
不同于当下Coding领域卷到饱和的Qwen、Deepseek系列,这些模型主要冲刺短时基准,Dots-3的定位非常明确:专为“十小时以上真实生活Agent”而生。用户可以交给它规划跨城旅行、执行中途调整,甚至结合视觉输入实时优化方案。
官方规格一锤定音:总参数280B,但激活参数仅16B。这是典型的MoE(Mixture of Experts)架构——就像一个专家团队,只在需要时叫醒其中一小部分人,而不是把所有人全叫醒。视觉能力也采用MoE设计,进一步降低了计算冗余。
我当时就想:这东西在家用消费级显卡上跑得起来吗?
第二章:我怎么把512K上下文的巨兽塞进本地?从下载到跑通Agent的完整踩坑实录
第一步:从官方渠道下载。推荐先去ModelScope搜索“Dots-3”或直接拉取Hugging Face上的量化版本(4bit/8bit)。整个过程不卡,十几分钟就能完成下载。
第二步:部署工具选SGLang。SGLang对MoE模型的优化做得非常好,能完美支持稀疏激活特性。启动命令大致是这样:
bash
python -m sglang.launch_server \
--model /path/to/dots-3 \
--tp 1 \
--quant 4 \
--context-length 512000 \
--port 8000
最低硬件门槛定在24GB+ VRAM。实测一张4090(12GB)勉强能跑,建议双卡或更高配置更稳。
部署完后,我立刻用nvidia-smi监控显存占用。刚开始峰值能到38GB左右,但因为MoE只激活16B,实际消耗比Dense模型低了一个数量级。
我搭建了一个真实长时程任务:“帮我规划一场北京到上海的跨城旅行,包含交通、住宿、餐饮,然后根据实时天气和航班信息持续调整,还得调用地图API和天气API。”
任务执行了12个小时,模型全程保持512K上下文,实时输出调整日志。过程中我输入了一张城市的卫星图,它立刻分析并优化了住宿选择。
第三章:激活参数只有16B,到底省了多少?硬核数据对比+长任务实测
MoE的最大价值就在于“省”。
官方数据已经很清楚:280B总参,激活仅16B。这意味着计算量和内存占用可以被压缩到Dense模型的1/15左右。
我把Dots-3和主流MoE模型(以Qwen系列为代表)放在同一任务里对比:
- VRAM占用:Dots-3量化后约24-48GB即可稳跑,Dense 280B理论上需要数TB级显存,其他MoE模型通常在60-120GB区间。
- 速度:MoE稀疏激活让tokens/s在长上下文下依然保持较高水平,远超Dense模型的推理速度。
- 成本:本地跑电费远低于API调用,尤其跑十小时以上任务,省钱效果明显。
- 上下文利用率:512K超长上下文下,Dots-3依然能高效利用存储空间,其他模型常因显存瓶颈被迫截断。
在长时程Agent任务中,我观察到模型能保持自我批判能力。几十轮执行后,它会主动分析“当前计划效率降低”,并在下一轮中调整路线、降低成本。这不是简单的工具调用,而是真正的“边跑边思考”。
对比之下,Dense模型在长任务中容易出现幻觉和上下文遗忘,而Dots-3凭借TEMPO机制,自我学习能力更强。
第四章:从小白到进阶的落地清单+我踩过的坑与优化建议
预算方案一(入门):16GB+显存笔记本 + 轻量化配置,能跑短时Agent。
方案二(推荐):单卡4090 + SGLang,24GB以上显存,适合10小时以上任务。
方案三:双卡A6000或RTX 5090,多卡TP并行,追求极致速度。
常见报错解决:
- OOM(显存不足):立刻切换到更激进的4bit量化,或减少context length。
- 多模态输入卡住:SGLang对图像的处理支持很好,但需注意特殊token格式。
- 工具调用失败:确保模型被赋予足够的工具调用权限。
TEMPO思想融入自己的Agent框架并不难。核心是让模型在每轮执行后输出“自我评分 + 下一步计划”,再用长上下文持续保留历史。这种“边跑边打分”的机制,能让普通模型也扛住几十小时真实任务。
多模态实战Tips:图像输入时先让模型描述场景,再调用视觉分析;音频任务则结合TEMPO的反思机制持续优化。
本地跑确实爽,但显存不够或想快速验证想法的朋友,其实可以直接通过 api.884819.xyz 调用同样的Dots-3接口(限时免费额度还在),几行代码就能把长时程Agent跑起来,省去量化调试的麻烦——我自己验证任务时也经常两边切换。
python
示例:通过8848AI平台调用Dots-3接口
import requests
url = "https://api.884819.xyz/v1/chat/completions"
headers = {
"Authorization": f"Bearer {your_api_key}", # 替换为实际密钥
"Content-Type": "application/json"
}
data = {
"model": "dots-3",
"messages": [
{"role": "system", "content": "你是一个擅长长时程Agent规划的助手。"},
{"role": "user", "content": "帮我规划北京到上海的跨城旅行,包含实时调整逻辑。"}
],
"max_tokens": 8192,
"temperature": 0.7
}
response = requests.post(url, headers=headers, json=data)
print(response.json()["choices"][0]["message"]["content"])
新用户注册即送体验token。
结尾钩子
下次我会用Dots-3的TEMPO思路,手把手教你在自己的Agent里实现‘边跑边自我打分+持续学习’,让普通模型也能扛住几十小时的真实任务……想看的扣1,下篇见!
本文由8848AI原创,转载请注明出处。关注8848AI,带你从零开始学AI。
#Dots-3 #MoE模型 #本地部署 #Agent开发 #长上下文 #人工智能 #8848AI #TEMPO #开源模型 #AI落地