这OpenAI和Tibo是不是脑子里都是屎?AGENT.md明确界定了子智能体“Astra”只能用于界定架构和边界,执行由Luna负责,Sol负责调度/Dev/Test。
结果对话的时候,本机Windows测试一次,Linux独立环境\WSL2上测试一次,服务器新开临时目录测试一次,Docker容器内再测试一次。每次测试Luna作为执行端都会向Astra交付大量上下文,然后又给Sol甩给长上下文修改,Sol又给Luna交付,一次循环将近消耗5H限额的百分之三十上下。
如果说生产环境确实需要大规模测试,尚且可以理解。
那能不能告诉我为什么一个极为简单的后端接口要疯魔一样的分别用业务平均并发、低并发、和瞬时极高并发测试好几轮?最后开始扩展到接口的稳定性又对接口进行了一大通修改,随后再次运行这种恐怖的无限制测试,完全忘记开发原目标只不过是用Py调用一个Rust写的下载器而已。
上个厕所回来仅仅十分钟不到,5H限额直接被打穿,连负责部署的Luna都无法使用。
别玩你那弱智28天挑战了,重置再多次也无法改变模型本身在实际开发过程中的低能表现,这种夸张到人类完全无法理解的测试我只在OpenAI这里见过。
ChatGPT现在笨得很
怕你重置用不完,帮你用用。
或许这也是为啥codex本身对调用子代理比较消极的原因,至少没claude那么积极
gpt的过度防御编程是真的蠢
@BD5DF #1 整个工程设计有重大问题,轻开发和架构,重测试,仿佛无限测试能拯救本身代码的不足一样。
测试的目的是让生产环境顺利上线,而后续的反馈由日常用户和Log进行,最终趋于稳定。而不是先预设各种存在于Tibo脑子里的脑残场景,然后用这些假设疯狂测试完全不会遇到的场景。
只能说,Codex是个没办法拯救的玩意儿,从一开始目标就是错的。
我现在都不开子agent,纯人工调度,熟练手打Handoff交接
6
不只是编程场景下过度防御,写东西的免责式声明、保险式声明简直让人无语,大堆大堆的不……、不是……。