一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

从一句需求到 App Store 送审:AI Agent 千步自主开发实录

时间:2026-09-21 08:00:02 编辑:袖梨 来源:一聚教程网

让 AI 写出几段代码并不稀奇,真正困难的是把模糊需求一路推进到可交付状态。一次 Mac 应用实验把这条链路延伸到了市场调研、编码、自测、打包和 App Store 提审,同时也暴露出浏览器自动化失控与任务边界不清带来的巨大消耗。下面从完整执行记录出发,分析哪些环节已经可以交给 Agent,哪些仍需人工设防。

一句话需求到 App Store 提审:AI Agent 一夜跑了 960 步,我只发了 8 条消息

先说结论

  1. **Agent 已经能独立走完"立项 → 编码 → 打包 → 上传 → 送审"的全链路。**不是演示,是真实产物:一个叫 KinetZen 的 Mac 菜单栏 app,提交进 Apple 审核队列(WAITING_FOR_REVIEW),代码 1034 行 Swift,在 Apple 那边排队等审。
  2. 我给的全部输入是一句话:"做一个创意 Macos app,你自己分析 App Store 榜单,以 Kinet 开头命名,新建目录,做到 App Store 上架。"之后一整晚,人类只发了 8 条消息——其中 5 条是纠偏,3 条是"继续"。
  3. :962 步工具调用,125M tokens,成本 $8.82,墙钟 9 小时(人睡觉的时间)。同样的事外包一个 iOS 工程师,报价按周算。
  4. 也有翻车:两轮各烧掉 500+ 步、4 美元——一次是浏览器自动化死循环,一次是我以为它做完了其实没做完。失败的 token 占了全程 2/3,这两轮恰恰是最值得复盘的。

Agent 自主做了什么(按时间线)

第一轮:22:22,一句话之后,Agent 干了 518 步(4.19 美元)

  • 市场调研:抓 US Mac App Store 免费榜,发现 Productivity/Utilities 霸榜、AI 笔记是红海、桌面美化类(WidgetWall #12、ColorWidgets #29)有免费流量、Endel 3.3 万评分证明专注声景的付费意愿——自己写了份榜单分析文档,自己定了赛道:零权限、零音频资产、菜单栏常驻的"专注禅庭"。
  • 写码:SwiftUI + AppKit 混合,Canvas 600 粒子庭园、4-7-8 呼吸环、AVAudioEngine 实时合成声景、SQLite 连续打卡、四语本地化。
  • 踩坑自修:遇到 segfault,自己抓崩溃栈——SQLite C API 手动 finalize 后 defer 又 finalize 一次,double-free。修掉后把同类隐患全查了一遍。
  • 目视断言:按"进程存活≠UI 正确"的铁律,启动 app 截屏确认渲染,然后 xcodegen 工程、生成图标、Release 打包——pkg 仅 892KB
  • 到这里天没亮,卡在 ASC 登录,它停手了。

我睡觉,它把 892KB 的 pkg 传上 App Store Connect

凌晨,asc-watch 自动盯守 + 我早上两条消息后,build 关联、元数据、年龄分级、隐私问卷、5 类 ASC 隐藏缺项(那个只认 409 报错的清单)全部补完,提审进入 WAITING_FOR_REVIEW。从一句话到进入 Apple 审核队列,中间人类参与度约等于一个产品经理在开早会。

最后它被我骂了一句才想起 git

代码写完、送审完成,git 是干净的——文档全落盘却没 commit。我发了条"文档落盘了却不 commit?",它按逻辑分组拆了 3 个 commit 补齐,顺手把"菜单栏 app 高发拒因清单"(2.4.5iii 最小功能、截图必须含菜单栏运行态)也沉淀成了文档。

烧钱复盘:960 步里,2/3 的 token 花在了两个坑上

轮次步数花费发生了什么
开发+打包518$4.19有效:调研→编码→自修 segfault→打包,一条龙
iOS 版尝试331$4.23报废:几十次 mouse_click/keyboard_type 打不进 Safari 登录 iframe——键击全进了前台另一个 app 的窗口。Agent 第 70 次左右才发现("连续十几次点击输入都打不进去,先停手"),自己叫停并换了策略
收尾113$0.40有效:元数据核验、commit 拆分、runbook 沉淀

两个教训都值钱:

  1. **GUI 自动化是 Agent 的成本黑洞。**同为 automation,shell 370 步干成了整个 app,浏览器键击 200+ 步连个登录框都进不去。能走 API 的绝不开浏览器,这条现在刻在我的工具集里。
  2. **"没做完"比"做错了"更贵。**iOS 那轮的 4 美元不是技术失败,是任务边界没划清——我上一句还在说 Mac app,下一句突然要 iOS 版,Agent 没有先确认平台差异就硬冲。任务切换时,一句"这是新任务,先列计划"值 4 美元。

为什么是"960 步"而不是"21 轮"

上一篇(21 轮交付一个功能)发出去,最多的问题是"这算自主吗,不是你在带它走?"这篇把尺度拉满:单轮内 518 步连续工具调用,中途零人类输入。轮是人的,步是它自己的——评价 Agent 自主度的单位从来不是对话轮数,是两次人类介入之间的步数。

给开发者的三条可复用结论

  1. 一句话需求是可行的,前提是 Agent 有"自己找验收标准"的能力。"做一个创意 app"这种指令能跑通,是因为它自己拆出了"查榜单→找空位→立项→上架"的验收链;没有这层能力的一句话需求,得到的只会是一份空想 PRD。
  2. **失败轮的 token 占比是 Agent 成熟度的最好的指标。**960 步里 2/3 花在两个坑上,说明这套系统的下一版优先级很清楚:堵死 GUI 自动化,管住任务边界——比再优化 10% 的编码效率值钱得多。
  3. 提审是分水岭。"AI 写了个 app"满地都是,"AI 写的 app 进了 Apple 审核队列"要求它同时搞定代码签名、App Store Connect 的 409 缺项、隐私问卷、四语截图——工程链路的最后一公里才是 Agent 的真实水平

这套东西在哪跑

上述全流程发生在 KinetAios(GitHub: phinn/KinetAios,GPLv3):本地优先的多引擎 AI Agent 桌面端,Windows / macOS 双端,自带长期记忆、962 步审计日志(每一步的工具/耗时/token 都可回放)、BYO-Key 不抽成。本文成本数据直接取自它的 token 审计面板。

  • 开源仓库:github.com/phinn/Kinet…
  • KinetZen 等 Apple 审核结果,过了会写后续篇:审核答辩词(2.4.5iii)怎么准备、拒审四步预案怎么跑。

下一篇预告:长期记忆系统的踩坑实录——为什么向量检索不是记忆的全部。

热门栏目