AI
别再让 AI 装专家了:2026 年三篇研究把我从 prompt 神话里打醒日期: 2026-07-04162 种专家人设 prompt,幻觉率 18.7% vs 9.8%;让 Claude 思考越久,斑马逻辑题准确率掉 23%;多模态模型上思维链越长越看不见图。2026 年开年三篇研究从三个方向戳破了过去三年 prompt 工程的核心信念。
上下文越大越好是一个谎言——GitHub 2026 报告里那个被忽视的数字日期: 2026-07-03当大模型上下文窗口从 8K 膨胀到 1M,我们以为可以塞下整个代码库了。GitHub 6 月的报告里藏着一个被集体忽略的数字——超过 60% 的开发者,因为盲目信任自动化补全,code review 的时间翻了一倍。
AI之后还会有什么——一个老韭菜对第三轮狂热的小观察日期: 2026-06-27经历了 Web3 和元宇宙两轮概念炒作的老人,这次面对 AI 浪潮,反而没那么兴奋了。
Prompt Engineering 已死?Harness Engineering 才值钱日期: 2026-06-24花三周精调出来的 prompt,换个任务直接掉回 60%。OpenAI 一个团队靠 88 个 AGENTS.md 写了一百万行代码。真正让 AI 稳定工作的不是 prompt 的措辞,而是上下文、约束、流程、工具这些系统性的东西。这篇文章想聊聊为什么我认为 Prompt Engineering 这个概念被高估了,以及 Harness Engineering 才是值得花时间的方向。
AI Agent 演示看着惊艳,一上线就崩日期: 2026-06-23当演示环境的成功率乘以五步链路,剩下多少?
当 AI 一本正经地编了一个不存在的病日期: 2026-06-22一个不存在的疾病 Bixonimania 被全世界最聪明的几个语言模型当作正经学问在讲。一个不存在的政府文件被 DeepSeek 编得抬头盖章齐全。「幻觉」这个词太温柔了,其实它做的事情更难听——它在伪造。
当 AI 让你觉得自己变快了,但数据说你慢了日期: 2026-06-21METR 的随机对照实验:经验丰富的开发者自信估计 AI 让自己快 20%,实测反而慢 19%。这个 300 万人围观的反直觉结果,撕开了「AI 让你变快」这个被普遍相信的幻觉。
我不用 Agent,也不用 Skill,我回到了 Workflow日期: 2026-06-20当所有人都在推 Agent 和 Skill 时,我把那个被 Agent 跑坏的 cron 服务回滚了——回到一百行的 shell 脚本,LLM 只在需要时才被调一次。可审计、可预测、成本可控,这才是我需要的工作流。
当代码不再是资产日期: 2026-06-19软件行业有一条默认公理:代码是要被维护的资产。可当 LLM 让我们随手做出「用完即弃」的小工具,这条公理正在悄悄失效——而失效的远不止公理本身。
为什么你用 AI 写代码感觉快得像飞,身体却诚实得像驴日期: 2026-06-18METR 的实验让我们看见了一个尴尬的事实:资深开发者用 AI 写代码,反而慢了 19%;可他们自己坚信自己快了 20%。这 39 个百分点的偏差,可能比任何一个 AI 模型都更值得研究。