一个研究 LLM for Code 的研究者,拿 400 美元做了个实验:给 Gemini 3.8 Flash、GPT Astra 6、Opus 5、Fable 5 四个前沿模型各 $100 预算,让它们自主开发一款「用户体验极好」的开源 PDF 编辑器——结果是「点几下就能在几乎每个里找到 bug」。作者 nielstron 据此提出:coding agent 不能像人一样和软件交互,所以它们...