DeepSeek-R1 到底省不省钱?我跑了两周,发现它只在两类任务上真正划算
DeepSeek-R1 到底省不省钱?我跑了两周,发现它只在两类任务上真正划算 如果把我这两周的 API 账单摊开看,最直观的变化不是“模型变强了”,而是账单终于开始往下走——但与此同时,我也悄悄把两类任务切回了原来的模型。 这件事很像换电动车:城市通勤确实省,但一旦你要跑长途、爬坡、频繁开空调,账
新人软件配置教程
未读
RAG答得像,不代表做对了:LangSmith把“检索质量幻觉”照了原形
RAG答得像,不代表做对了:LangSmith把“检索质量幻觉”照了原形 我做 RAG 的前六个月,状态其实挺像一个“自我感觉良好”的学生。 分块切好了,embedding 调了,top-k 也试过几轮;自己拿几条熟悉的问题一测,答案顺得像教科书,甚至还能顺手补两句解释。那段时间我几乎已经默认:这套
Copilot Agent 接进报价审批后,我才明白:省时间的不是“全自动”,而是“该自动的那一段”
Copilot Agent 接进报价审批后,我才明白:省时间的不是“全自动”,而是“该自动的那一段” 接上 Copilot Agent 的第一周,我以为自己发现了宝藏;第六周,我在晚上十一点手动处理了一份它搞砸的报价单。 这件事很打脸,但也很诚实:AI 自动化从来不是“接上就省时间”。真正省时间的,
可灵运镜控制到底值不值得信?我跑了 15 组测试,整理出一张可信度评级表
可灵运镜控制到底值不值得信?我跑了 15 组测试,整理出一张可信度评级表 我以为这次运镜控制会是玄学,结果发现它只有一半是。 推、拉、摇、移,已经能用了;旋转和复合运镜,还是得看模型当天心情。 如果你也在纠结一个问题——“这功能到底是噱头,还是能真干活?”——那这篇就是来交作业的,不是来写广告的。
Claude 3.7 Sonnet 的 Extended Thinking 不是自动挡
Claude 3.7 Sonnet 的 Extended Thinking 不是自动挡:什么时候该开,什么时候关 我第一次认真用 thinking,心里想的是:这下稳了,复杂问题交给模型“多想一会儿”,答案应该更漂亮。 结果很打脸。 一个本来一句话就能回答的简单问答,它先沉默了好几秒,像是在认真做数
我拿报销流程测了 Manus 和 Operator:差别不在“会不会点”,而在“能不能把事做完”
我拿报销流程测了 Manus 和 Operator:差别不在“会不会点”,而在“能不能把事做完” 我以为它在帮我操作浏览器,结果盯着看了三分钟,发现它一直在点同一个按钮。 那一刻我突然意识到:AI Agent 的浏览器自动化,最容易在演示里赢,最容易在真实流程里输。 所以这次我没选“帮我搜个资料”“
长上下文不是谁更准:我用 10 万字文档看懂 Gemini 2.5 Pro 和 Claude 3.7 Sonnet 的真正差距
长上下文不是谁更准:我用 10 万字文档看懂 Gemini 2.5 Pro 和 Claude 3.7 Sonnet 的真正差距 你把一份年报、合同,或者一整本公开报告扔给模型,心里想的往往只有一件事:“帮我把答案找出来。” 但真实工作里,最折磨人的从来不只是“找没找到”,而是这两个瞬间: 1. 模型
我亲手攻击了自己的 Agent,才发现最危险的不是“被黑”,而是“它自己点头”
我亲手攻击了自己的 Agent,才发现最危险的不是“被黑”,而是“它自己点头” 我以为系统提示写得够严,直到我开始自己攻击自己。 这不是吓人,是我最近做的一次很普通、但很不舒服的测试。 起因很简单:我想知道,如果我是攻击者,会先从哪里下手。结果第一轮就撞上了一个很典型的提示词注入尝试——一句看起来像
新人软件配置教程
未读
本地跑 Llama 4 Maverick,到底值不值得?先别急着部署,先算清这三笔账
本地跑 Llama 4 Maverick,到底值不值得?先别急着部署,先算清这三笔账 我花了三天把它跑起来,第四天才意识到:有些活,API 真的更香。 这不是一句“本地部署没用”的反话,而是一次很现实的提醒。Llama 4 Maverick 这类 MoE 大模型,能跑和跑得舒服是两回事。你以为只是多
别只盯着单价:我把周报流程切给 DeepSeek V3 两个月后,最贵的反而不是 API
别只盯着单价:我把周报流程切给 DeepSeek V3 两个月后,最贵的反而不是 API 有一天晚上,我盯着账单看了很久。 那天只是一个普通的周报生成任务:先把零散的项目记录喂给模型,再让它整理成固定格式,最后润色成能直接发给老板的版本。结果因为上下文没喂顺、格式约束又写得太松,我一共重试了 11