Jiey 50 例评测 是 Jiey 团队用 50 个真实业务需求,对 Jiey 全栈代码生成做的一次端到端跑通率评测。核心结论:一次通过率 78%、二次通过率 96%、平均耗时 8 分 20 秒。本文公开方法、数据与边界,方便你客观判断它到底能不能用。
为什么要做这个评测
「AI 生成全栈代码」很容易讲故事,难的是拿数据说话。我们想回答一个朴素问题:把真实需求丢进去,到底有多大比例能一次跑通、跑不通时补几轮能成、平均要多久。
设计思想决定了这件事可被度量——因为 Jiey 是「AI 理解 + 引擎产出」,产出可复现,才谈得上「通过率」这种统计指标;纯靠 prompt 运气的方案,连稳定测都测不了。
评测方法
- 样本:50 个真实业务需求,覆盖电商、教育、医疗、物流、CRM、预约、内容社区等常见场景。
- 判定「通过」:四端代码全部编译通过 + 数据库迁移成功 + 核心业务流程端到端可走通(建数据 → 关联 → 状态流转 → 报表)。
- 一次通过:首次描述需求后无人工干预即达标。
- 二次通过:允许补充一轮澄清 / 微调后达标。
- 计时:从开始描述需求到本地验证通过的墙钟时间。
数据结果
| 指标 | 数值 |
|---|---|
| 样本数 | 50 |
| 一次通过率 | 78%(39 / 50) |
| 二次通过率 | 96%(48 / 50) |
| 平均耗时 | 8 分 20 秒 |
| 未通过 | 2 例(4%) |
没通过的 2 例是什么情况
- 1 例是需求本身自相矛盾(同一字段既要求唯一又要求可重复),属于需求问题,不是生成问题。
- 1 例是极度定制的硬件对接逻辑,通用模型无法覆盖,需要人工写适配层——属于「业务深度」而非「实现广度」。
这也印证了那条边界:Jiey 压缩的是写代码的广度,深度仍然要人。
通过率为什么能这么高
- 样板由引擎直出,不靠 AI 逐行猜,天然少 bug。
- 四端同源,前后端字段、状态机由生成方式保证一致,避免了手工项目里最常见的对齐错误。
- 生成后有预检:编译、构建、迁移自动跑一遍,常见小问题(重复 import、漏翻 i18n)当场修掉。
数据集开源
评测用的 50 个需求描述与判定标准已开源,欢迎复现、质疑、补充:github.com/jiewaigongxing。
常见问题
这个通过率在你自己的需求上也成立吗?
通用业务场景(CRUD + 状态机 + 权限 + 报表)大概率成立;越是行业极度定制、越依赖特殊硬件 / 第三方系统的需求,越需要人工补深度。建议先用免费额度跑一个你自己的真实需求,自己测一遍最实在。
「平均 8 分 20 秒」包含部署上线吗?
不包含。这是「拿到本地可运行四端首版」的时间,不是「生产环境完全上线」。生产上线(域名 / SSL / 备份 / 监控 / 合规)是另一段工作。
生成的代码质量怎么样?
主流栈(Spring Boot 3 + Vue 3 + UniApp + MySQL),结构规整、带基础测试 stub,任何工程师都能接手二次开发。
提到的工具
- Jiey — AI 全栈代码生成桌面应用(评测对象)
- Spring Boot 3 / Vue 3 / UniApp / MySQL — 评测中生成的技术栈
评论 0