2026-10-08 来源:如何解决 AI 信任问题:基于 2026 Stack Overflow 开发者调查
- 源文件:
source/_posts/ai-trust-verifiable-infra.md - 分类:AI工程化
- 标签:AI编程
- 日期:2026-10-08 11:40:00
- 外部数据:2026 Stack Overflow 开发者调查
摘要
开发者普遍在用 AI,却很少真正放权。瓶颈已经从「会不会写代码」变成「AI 能不能证明自己写得对」和「AI 懂不懂项目」。作者主张把重点从提升生成能力转向构建验证闭环,给出证据包、自动验证、按风险分级权限、重构记忆系统四个方向。
要点
- 调查数据(文中引用):80% 每天至少用一小时 AI,87% 说信任 AI 输出,但只有 6.6% 愿意让 AI 参与重要工作决策。
- 不敢放权的两个原因:
- 黑盒焦虑:48% 只在结果容易验证时才信任 AI。核心业务代码没有推导和依据,没人敢直接合并;带了「依据」也可能掺幻觉。
- 上下文饥渴:63.2% 面临信息不完整,60.9% 的关键知识只在资深员工脑子里。开发者认为 AI 最需要的上下文是项目目标和需求(85.2%)、代码和技术文档(73.3%),聊天和会议记录只占 15.8%。
- 把记录堆进向量库解决不了问题:AI 不知道历史决策背景,会写出看似正确但违背团队约定的代码。
- 四个方向:
- 证据包:93% 认为引用来源很重要。回答带出处、文件版本、适用范围和冲突来源,做到可引用、可追溯、可复现。
- 自动查岗:写完代码自动跑测试和静态检查,改 UI 打开页面截图,查数据返回原始 SQL 和数据时间。AI 能自己交执行证据,人才能省下审查时间。
- 按风险分级权限:只读默认自动;可恢复修改自动执行并留撤销点;外部写入先预览;发布、付款、权限变更必须人确认。
- 重构记忆:不只追加聊天摘要。上下文层要有权限、版本和时间,区分事实、决策、偏好和临时状态,并有过期和纠错机制。
- 结语:多 Agent 的核心是清晰的责任边界。不需要模型更「敢做」,而要每一步可验证、可追溯、可控制。作者团队的 Agent 用户反复关心内容可靠性,证据链方案的效果还待验证。
另见
- Agent 工作流(分级权限决定哪些节点必须等人)
- Harness Engineering(多加可验证性,而不是多加规则)
- AI 辅助开发
- Chat assistant user memory
- Vibe Coding 开了一堆会话,验收不过来
维护:Cursor Agent,2026-10-08。