50张票据交给多模态AI:金额都读对了,为什么总账还是错的?
50张票据交给多模态AI:金额都读对了,为什么总账还是错的? 50张发票和付款截图交给多模态 AI 后,它几乎都读对了金额。 但把结果加总,我却发现总支出明显偏大——同一笔消费的订单页、付款截图和电子发票,被它算了三遍。 这类错误比“看错一个小数点”更危险。金额识别错了,通常一眼就能发现;重复记账却
新人软件配置教程
未读
别再相信“合法 JSON”:用 Schema、自动修复与安全写表搭建可靠的数据提取流水线
别再相信“合法 JSON”:用 Schema、自动修复与安全写表搭建可靠的数据提取流水线 批量处理销售沟通记录时,最让人崩溃的往往不是模型直接报错,而是它看起来成功了。 前几十条数据正常写入,第 37 条突然少了 phone,后面的列开始错位;有些手机号被当成数字,导出 Excel 后变成科学计数法
AI聊到第30轮为什么总跑偏?用「项目简报+决策日志+当前状态」重做上下文
AI聊到第30轮为什么总跑偏?用「项目简报+决策日志+当前状态」重做上下文 第7轮,我们已经明确否决了方案B。 第26轮,AI却一本正经地把方案B当成最终方案,继续往下写页面结构。 更麻烦的是,它并不是完全忘了前文:目标记住了一半,约束漏掉两条,还把一个“等待确认”的功能当成已经通过。 这种感觉很像
AI 浏览器真能提效吗?用同一套任务实测 Comet、Dia 与 Chrome+AI 侧边栏
AI 浏览器真能提效吗?用同一套任务实测 Comet、Dia 与 Chrome+AI 侧边栏 AI 浏览器最容易制造一种错觉:10 分钟的惊喜,30 分钟的返工。 一份资料刚丢进去,它很快便生成了结构完整的摘要、对比表和结论。可当你逐条点开引用,问题才开始浮出水面:有的链接只到了网站首页,有的结论来
新人软件配置教程
未读
Claude Sonnet 4.6 编程实战:从一句需求到可测试、可回滚的完整项目
Claude Sonnet 4.6 编程实战:从一句需求到可测试、可回滚的完整项目 你只说了一句“帮我写一个任务管理网站”,Claude 很快返回几百行代码。 看起来效率惊人,但接下来的问题一个比一个具体:文件该放在哪里?依赖怎么安装?为什么搜索后页面没有刷新?这段代码会不会把原来的功能改坏? AI
AI应用案例
未读
Codex 一句话"随手搓"出神站?先把完整生成过程拿出来
最近,刷到一类内容开始多了起来:视频里是满屏流畅的 3D 动效、精致的排版布局、顶级的视觉质感,配文写着"用 Codex 随便搓了个网站,效果炸裂",然后顺理成章地引导你报课、买 Skill、付费进群。 画面很好看,但有几个问题值得认真想一想。 一、你看到的"效果",未必是 AI 生成的 部分流传的
“一句 Prompt 生成满屏 3D”是真的吗?用五条清单拆掉 AI 演示里的障眼法
“一句 Prompt 生成满屏 3D”是真的吗?用五条清单拆掉 AI 演示里的障眼法 屏幕上只输入一句话,几十秒后,粒子、灯光、镜头动画和鼠标交互全部出现。 评论区一半人在喊“前端要失业了”,另一半人在骂“视频肯定造假”。 问题是,这两边可能都只说对了一半。 画面有可能是真的,代码也可能确实由 AI
Codex“一句话生成完整产品”是真的吗?别急着站队,先看证据链
Codex“一句话生成完整产品”是真的吗?别急着站队,先看证据链 视频里只输入了一句话,几十秒后,一个能运行的网站出现了。 但镜头没有告诉你:项目是不是空的、模型失败了几次、谁修了报错,以及这个结果能不能再来一次。 这类 Codex 演示最容易引发两种极端反应。 一种是兴奋:“程序员真的要被替代了。
别再让 Agent“假装完成”:一套可验收、可追溯、会退出的任务契约 Prompt
别再让 Agent“假装完成”:一套可验收、可追溯、会退出的任务契约 Prompt “任务已完成,所有内容均已检查无误。” 这可能是 Agent 最让人放松警惕,也最危险的一句话。 检查了什么?依据是什么?哪些步骤真正执行成功了?如果它没有访问权限,为什么没有停下来?如果资料互相冲突,它凭什么给出确
新人软件配置教程
未读
别急着换电视:改完这 9 个设置,1500 美元的三星电视才真正“开机”
一台价值 1500 美元的三星电视,用了整整三年,主人一直觉得画面“还可以”。 直到一位做家庭影院安装和电视校准的朋友上门,只看了屏幕 5 秒,就指出了一串问题:画面模式是为卖场准备的,运动平滑制造了“肥皂剧感”,节能选项压低亮度,锐化滤镜增加噪点,电视的观看信息识别功能也没有关闭。 他只花 12