Jiey 50 例评测 是 Jiey 团队用 50 个真实业务需求,对 Jiey 全栈代码生成做的一次端到端跑通率评测。核心结论:一次通过率 78%、二次通过率 96%、平均耗时 8 分 20 秒。本文公开方法、数据与边界,方便你客观判断它到底能不能用。

为什么要做这个评测

「AI 生成全栈代码」很容易讲故事,难的是拿数据说话。我们想回答一个朴素问题:把真实需求丢进去,到底有多大比例能一次跑通、跑不通时补几轮能成、平均要多久。

设计思想决定了这件事可被度量——因为 Jiey 是「AI 理解 + 引擎产出」,产出可复现,才谈得上「通过率」这种统计指标;纯靠 prompt 运气的方案,连稳定测都测不了。

评测方法

  • 样本:50 个真实业务需求,覆盖电商、教育、医疗、物流、CRM、预约、内容社区等常见场景。
  • 判定「通过」:四端代码全部编译通过 + 数据库迁移成功 + 核心业务流程端到端可走通(建数据 → 关联 → 状态流转 → 报表)。
  • 一次通过:首次描述需求后无人工干预即达标。
  • 二次通过:允许补充一轮澄清 / 微调后达标。
  • 计时:从开始描述需求到本地验证通过的墙钟时间。

数据结果

指标数值
样本数50
一次通过率78%(39 / 50)
二次通过率96%(48 / 50)
平均耗时8 分 20 秒
未通过2 例(4%)

没通过的 2 例是什么情况

  • 1 例是需求本身自相矛盾(同一字段既要求唯一又要求可重复),属于需求问题,不是生成问题。
  • 1 例是极度定制的硬件对接逻辑,通用模型无法覆盖,需要人工写适配层——属于「业务深度」而非「实现广度」。

这也印证了那条边界:Jiey 压缩的是写代码的广度,深度仍然要人。

通过率为什么能这么高

  • 样板由引擎直出,不靠 AI 逐行猜,天然少 bug。
  • 四端同源,前后端字段、状态机由生成方式保证一致,避免了手工项目里最常见的对齐错误。
  • 生成后有预检:编译、构建、迁移自动跑一遍,常见小问题(重复 import、漏翻 i18n)当场修掉。

数据集开源

评测用的 50 个需求描述与判定标准已开源,欢迎复现、质疑、补充:github.com/jiewaigongxing

常见问题

这个通过率在你自己的需求上也成立吗?

通用业务场景(CRUD + 状态机 + 权限 + 报表)大概率成立;越是行业极度定制、越依赖特殊硬件 / 第三方系统的需求,越需要人工补深度。建议先用免费额度跑一个你自己的真实需求,自己测一遍最实在。

「平均 8 分 20 秒」包含部署上线吗?

不包含。这是「拿到本地可运行四端首版」的时间,不是「生产环境完全上线」。生产上线(域名 / SSL / 备份 / 监控 / 合规)是另一段工作。

生成的代码质量怎么样?

主流栈(Spring Boot 3 + Vue 3 + UniApp + MySQL),结构规整、带基础测试 stub,任何工程师都能接手二次开发。

提到的工具

  • Jiey — AI 全栈代码生成桌面应用(评测对象)
  • Spring Boot 3 / Vue 3 / UniApp / MySQL — 评测中生成的技术栈

相关阅读