跳到正文

目录

把 AI 调成世界级设计师:Anshu Chimala 的三阶段七手法

关于这篇文章。 这是一篇译文 + 译注,原文是 Anshu Chimala 在 Lenny’s Newsletter 的客座长文 How to turn your AI into a world-class designer(2026 年 9 月 1 日发布)。Anshu 此前在 Apple 带了 12 年软件工程与设计团队,专注未来 AI 产品的研究与原型。译文以中文 essay 风格重述他的方法论:不是逐句翻译,是按他的三阶段(Discover/Define/Deliver)七手法框架,把每个手法的"判断—推理—证据"链重组成中文读者更容易跟上的版本。付费墙挡住了 Technique 7"Remove AI tells"之后的细节,文中以**【付费墙】**显式标注。

出处:lennysnewsletter.com/p/how-to-turn-your-ai-into-a-world


你只看到了 AI 设计潜力的 1%

有人看完 Anshu 在 X 上贴的设计 demo 会问:“为什么同一个模型,在你手里就能做出那种东西,我自己跑出来全是千篇一律的样板货?感觉你用的是另一个模型。”

文章开头他就摆了三样产物回应:三句 prompt 用 Claude Fable 5 搭出来的对话式热量追踪 app,两句 prompt 用 Claude Opus 5 搭出来的太空探索游戏,三句 prompt 用 Claude Opus 5 + GPT-5.6 Sol 搭出来的动态落地页。

Anshu 用的不是另一个模型,他只是用得更深。他给出一个很刺激的判断:大多数人只看到了 AI 创造潜力的 1%,剩下 99% 不是模型不给,是方法没摸到。

这话不是营销话术。LLM(大语言模型)的工作机制是 next-token 预测——每一步,在已有 token 序列上预测下一个最可能出现的 token。人类评分回流进训练过程,模型因此学会了"挑最安全、最能让所有人满意"的路线。

设计是被这一性质伤害最深的任务之一。设计决策不是"对/错",是"出不出彩"——用什么色调、怎么排版、何时留白,都要做出选择。LLM 在每一个分叉口都会选"最不会得罪人"的那个 token。结果是设计看起来规整、像样,但和无数其他 AI 设计撞衫,撞到没个性。原文有句话说得更损:这就像终极版的 design by committee(委员会设计)——人人都点头,没有人在乎。

好设计正相反:先有情绪,从情绪反推表达;它打破规则,用让人记住、出乎意料的选择制造反应。这和 LLM 的本能互为镜像——模型每一步都选最可预测的,好设计每一步都要选最不可预测的。

所以 99% 的潜在设计空间,就藏在那个"让模型偏离最可预测"的缝隙里。Anshu 在 Apple 的 12 年里,大部分时间带一个 R&D 团队,做探索性未来 AI 产品的设计与原型。团队早期也被同样的问题困住——脑子里装着"UI 应该长什么样"的预设,回到熟悉的样式,转不出新东西。后来他们靠一套严格的流程硬把自己从"舒适区"里拽出来,专门往可能性边缘看,再把细节打磨到 Apple 那种质量。他把同一套流程搬到了和 AI 的协作上——过去团队要几周做完的原型,agent 现在几小时就能出。

方法论的骨架借鉴了设计领域经典的 Double Diamond(双钻模型),但被改造成面向"AI agent 团队"而不是人类设计师的三阶段:

  • Discover(探索):发散,跳出平庸的同质化,找到大胆、野心足的设计 brief(设计任务说明)。
  • Define(定义):收敛,把 AI 从熟悉的模式里推出去,多个模型组合起来,把设计真正实现出来。
  • Deliver(交付):精修,把粗糙的边角收掉,把关键元素立住,交付让人想用的成品。

下面三段按顺序展开。所有例子都来自 Anshu 真实跑过的 prompt 和产物。


Discover(探索):先广后深

设计最难的一刻是面对一张白纸——所有可能性都在。AI 是发散的理想工具,问题是它太容易退回到熟悉的模式。

要把模型从舒适区拽出来,Anshu 给两条相反的路:用外部的随机性,或者用你自己的品味

Technique 1:用"随机字符串"给模型注入多样性

直接让模型"做得独特一点"是没用的——LLM 不会真正"随机",它只会预测"听起来随机"的 token。Anshu 试过,跑出来的结果确实和之前不同,但谈不上多样:配色、结构还是那几套,连尴尬的陶艺隐喻都反复出现。

Anshu 引了 Sakana AI 的 String Seed of Thought(字符串种子思维)方法:让模型先用 shell 脚本生成一长串随机字母数字串,把这串字符当灵感来源,让它从字符串里"看出"颜色、版式、节奏。

原文 prompt 例子:

我要你给我的效率工具做一个产品落地页。按下面这套流程:

  1. 用 shell 脚本生成一长串随机的字母数字字符串。
  2. 基于这串字符去定义创意方向(配色、布局、字体等)。看表面之下的子模式、特殊数字、任何能启发你的东西。
  3. 用你的判断把方向变成好看的成品。
  4. 不要在设计里暴露这个字符串,它只用来启发你。

效果立刻拉开。原话:之前的设计是"任何 Claude 用户都能跑出来的";用了随机字符串之后,“每次跑都不一样,全世界独一份”。对照实验是这样的:Anshu 开了四个 Claude Code 实例(跑的都是 Claude Opus 5),同一个 prompt 跑四遍,出来的几乎是一个模子——紫色渐变、文字在左、图形在右;换用随机字符串,同一个 prompt、跑不同字符串,配色、字体、版式就完全对不上了。

这个手法解决的是 LLM 训练目标里的一个根本限制:模型本身不会随机,“随机感"必须从外部喂进去。

Technique 2:让你的 prompt 比模型更"野”

第二条路反过来——不是给模型随机性,是给模型具体的狂想。

关键不在 prompt 多长,在于你脑子里有没有具体的画面。一段 prompt 越具体越"出格",模型越有支点可以靠;越抽象越"帮我做个 X",模型越要靠默认偏好填空。

Anshu 列了几个例子 prompt:

给我效率工具做一个产品落地页,要硬核像素风 + 惊艳的视觉。每个区块看起来像电子游戏的静止画面,但所有这些还要能拼成一个能用的产品落地页。

给我效率工具做一个产品落地页,设定在等距视角的 3D 城市里,不同功能用不同街区或建筑来表达。

给我效率工具做一个产品落地页,版式要极度不对称、配色和字体要有冲突、留白要让人不舒服。打破所有规则,但还要好看。

难的是想出这些"具体的狂想"。AI 当然能帮——但你直接问 AI"给我点创意",得到的也是"所有人都能得到的那批"。

Anshu 的方法是三步:

  1. 广撒网。让 AI 列一长串灵感,描述故意只给高维度,目标是启发你,不是直接用。
  2. 挑方向,挑反应。你看完之后记录对哪些方向有"反应"(心动、烦、想试),再让 AI 在你挑过的方向上细化。
  3. 让 AI 写给 AI 的 prompt。满意之后,让 AI 写一个紧凑的 prompt,让另一个 AI agent 能直接拿去搭出概念验证页(POC)。

只把 AI 的创意原样喂回 AI,你拿不到独家;方向是你主动带进去的,最终成品里才有你。

Anshu 这一段的结尾话特别值得照搬:

别怕试听起来很蠢的念头。如果你在想"这肯定没戏",方向对了。多数时候 agent 会给你惊喜,你会意识到自己低估了它。如果没惊喜,就扔掉那一批再换。但那些"没奏效"的 prompt 要存下来,等下一代模型出来再跑一遍——你就在用最新的能力,把每一代的天花板量到极限。


Define(定义):把方向做深

Discover 阶段能拿到一批有意思的初步方向。但只要还是 AI 一口气跑完的,它们几乎都还是同一套老习惯——文字在左、CTA 按钮在下、导航在顶、图在右。

Define 阶段的目标是给每个设计一个独立的"人格"。下面三个 Technique 是 Anshu 用来做这件事的三个不同侧面。

Technique 3:用子 agent 做正向反馈回路

设计要迭代,但"让 agent 自己审视自己改一版"是死路——agent 不是客观的,它会维护自己之前的决定、过往的推理。“退一步想"不是它的强项。

解法:让写代码的 agent 问另一个 agent。第二个 agent 担任"设计评论员”,只看当前设计截图,不看代码、不看实现细节、不看历史迭代——只看成品有没有达到质量门槛。

这种分工的另一层好处是成本结构:贵的模型只用来做"高层判断",便宜快的模型干苦力。评论员的 token 占比远低于实施者,但提供的是"品味"那一层。

Anshu 给出的工作流原文 prompt:

我要你改进这个设计。要决定改什么,请用一个 Fable 5 子 agent 当设计评论员。 每次迭代按下面这套流程:

  1. 抓一张当前设计的截图。
  2. 在一个干净的 context 里调用评论员,只给它截图,不给代码、不给实现、不给历史迭代和评论。
  3. 让它评估当前设计要走的审美方向,想象顶级设计工作室会怎么走这个方向,列出差距最大的几点。
  4. 最后让它给一个 0-10 的分,表示当前设计离工作室级的差距。 给评论员的指令里要写明:
  • 要高屋建瓴看整体结构和构图,也要看细节。
  • 要警惕过度、堆砌、明显的"AI 味"模式,并扣分。
  • 要给具体、紧的反馈,不是空话散文。
  • 要敢想敢打分,别躲安全区域。 你的工作什么时候算完?看评论员独立给出 9/10 或更高不要把"9/10"这个门槛写进评论员的 prompt,让它打分时保持客观。每次迭代用同一个评论员 prompt。

Anshu 跑下来的一个数据:Fable 5 评论员每轮的输出 token 占比不到 10%。评论员模型看着贵,实际花费不到 1/10;直接让 Fable 改页面,成本翻倍还更慢。

设置这种循环有几个关键判断,原文分了四条:

  1. 评论员的标准要尽量客观具体
    • 烂 prompt:“判断我们的设计好不好看、不像 AI 做的。“太主观,每次跑结果波动很大。
    • 还行 prompt:“审视我们要走的审美方向,想象顶级设计工作室会怎么做,再用这把尺子量我们。“还是糊,但给了统一框架。
    • 好 prompt:“给你 5 张图:4 张专业参考 + 1 张我们产品的截图,按打磨度和品味打分。“具体、有视觉基准。
  2. 给评论员看参考图作为"目标质量基线”。可以是同类截图、你喜欢的设计,甚至 AI 生成的概念图。告诉它这是基线/moodboard,不是目标——你不希望它直接抄。
  3. 设置停止条件要小心。否则评论员可能永远不"满意”,agent 烧 token 也要去讨好它。先做一两轮,看是不是在收敛,再决定要不要继续。
  4. 不同活派不同模型。评论员可以考虑更大模型,更多参数通常意味着更好的设计感和更宽的创意分布。小的可以做实施者,但别太小——你还是需要一个能真正"执行设计方向"的模型。

Technique 4:用图片生成给设计补血肉

写代码的 agent 爱写代码,但不爱用图。它们倾向于走代码能轻松堆出的方案——渐变、形状、基础花纹——而这些恰好是最明显的"AI 设计痕迹”。

部分 agent 自带图像工具,但几乎不会主动用;没带的可以接 OpenAI 或 Gemini 的图片生成 API。

Anshu 给的 prompt 例子:

这个设计有点平。用图片生成加点个性。考虑 shader 或 3D 效果配合图片,做出更有意思的视觉。 图片生成用这个 OpenAI API key(只在本地用,不要存进代码或产品):sk-a1b2c3d4… 在浏览器里一帧一帧确认效果对。

效果见原文 demo:补上图片和 shader 之后,设计里的"AI 味"明显退掉——它开始像是有人认真做出来的东西,而不只是跑一遍代码就有的。

按你的 agent 栈怎么接图像生成,原文给了四个分支:

  • Codex / Antigravity / Grok Build:告诉 agent 用它自带的图片生成。它本来就会,只是没人提醒它才不主动用。
  • Claude Code 或其他 agent,但你还有 ChatGPT 订阅:告诉 agent “用 Codex CLI 生成图片。如果没装就帮我装。确保它走我的订阅而不是 API key 计费"。这样能复用订阅额度,不额外花钱。
  • 只用 Claude 或别的工具:最直接的路是给 agent 一个 OpenAI 或 Gemini 的 API key。Anshu 建议单独申请一个 key、设紧的额度上限——就算 key 漏了或者 agent 乱花,损失有上限,撤销也不影响其他工作。
  • 经常把 key 贴进对话的人:把 key 放进一个文件,让 agent 在项目里引用它。具体做法:告诉 agent “建一个被 gitignore 的 .env.agents 文件,把 key 存进去,在 AGENTS.md / CLAUDE.md 里给自己写一条说明:这些 key 给你开发时用,但绝对不能跟着产品一起 ship"。

Technique 5:用视频生成做更复杂的动效

视频生成模型今天的能力远超想象,普通人却还把它们当成 UGC 广告生成器或 Will Smith 吃意面那种演示。日常设计里它们能做的事远不止这些。

视频模型很多,最好的又经常换。Anshu 倾向用一个聚合平台(fal.ai)给 agent 一个 key,让 agent 自己评估选项、选最合适的,不做多套对接。

两个具体用法:

A) 做惊艳的循环动画

诀窍是先生成带纯色背景的循环片段,然后用色键(chromakey,绿幕原理)抠掉背景,复杂场景就上视频抠像(video matting)模型。这样能拿到一段动画,可以叠到 UI 任何位置而不像一段视频。

Anshu 给的 prompt 例子:

能把这页那张图换成一个更有意思的循环视频片段吗?让晶体碎裂、慢慢旋转。要做出玻璃般的效果,能折射页面背景,在周围投射阴影和光线。 要拿到可信的玻璃折射,先把玻璃的视频叠在页面背景色上渲染(这样折射就烘焙进去了),再用视频抠像模型抠背景。 用这个 fal.ai API key:sk-a1b2c3d4… 选最近合适的视频生成和背景移除模型。

原文里的 before/after 对比把这层差别交代得最直观——代码里做不出的焦散反射、玻璃折射、复杂物理运动(这组对比正是用 GPT-5.6 Sol 做的前后两版)。

B) 做状态之间的过渡

这个用例被严重低估。除了从文本生成视频,很多视频模型能在关键帧图像之间做插值。你拿两张产品静止图,它能生成一段过渡片——用户操作时(切到另一个页面)播一下,或者用户滚轮/滑动时一帧帧拖。

Anshu 的行李箱 demo prompt:

做一个行李箱 demo 页面,用视频模型在几个状态间做可交互过渡。每个状态行李箱要呈现不同样子,纵向运动要和滚动贴合:

  • 一开始行李箱悬浮在半空。
  • 然后落地、弹开。
  • 最后里面的东西从上方整齐地落进箱子里。 用你的图片生成能力出初始帧,再生成一段从这一帧动画到下一状态的视频。把这段视频的末帧当成下一段过渡的种子,让动画连着。看用户滚动,一段段拖动过渡。 用这个 fal.ai API key:sk-a1b2c3d4… 用物理和一致性强的视频模型,比如 Seedance 2.5。

原文里的行李箱 demo 把这层效果演了出来——整段交互是 GPT-5.6 Sol 在 Codex 里一条 prompt 跑出来的,页面之间过渡跟手滚动,流畅好玩。这种设计让人继续滚下去看你产品。


Deliver(交付):减法是最后一步

走到这一步,设计已经独特、有性格。剩下的是清掉细节、打磨到能给真用户用。AI 能造出惊艳的视觉,但"用起来是不是合理、是不是顺、是不是为用户服务”——这块要靠你的判断。

Technique 6:删掉所有不增加价值的元素

AI 爱加东西,几乎不会减。AI 设计最大的破绽之一就是过度解释、堆砌无功能的元素。克制的设计立刻就显得高级、有分寸

Anshu 修设计时,多数精力花在"删”。他在做一个热量追踪 app 时,第一版 Claude 出来虽然"已经是 AI 全自动做的,相当惊艳”,但他给的需求是"干净、极简”,出来的东西并不极简:

  • 背景和进度条上的粉色发光特效
  • 文字上零散的高亮和颜色
  • 列出当天所有食物的额外标签和留白(图片本身已经传达了)
  • 自定义的按钮和文本框,看起来比 iOS 原生控件还差

他把 prompt 改成:

  • 版式改成以图为核心的网格
  • 去掉渐变、光晕、不必要的容器
  • 目标是真正极简、Apple-native 的审美

改完之后效果好得多——有主张,让视觉自己说话;用 iOS 原生组件,过度的颜色和渐变消失,文本变小变紧。

关键判断:今天的 AI 模型永远不会自己想到做这些减法。AI 不爱冒险——删设计、删代码是冒险的事。模型需要你推一把。每次回看设计,问自己"这里真的需要吗”。屏幕上放得越少,能传达的反而越多。

Technique 7:去掉 AI 痕迹

【付费墙】原文 Technique 7 的正文及之后的细节位于 Lenny’s Newsletter 的付费墙之后,未对外公开。从 Technique 6 收尾的判断(“克制的设计让人高级,AI 不会自动做减法”)推断,Technique 7 会涉及识别并清除"AI 味"的具体痕迹——但具体手法待原文公开后补充。


三条可带走的判断

把 Anshu 的整套方法论折成三条可执行的判断。

判断 1:随机性和品味要"外购"。LLM 不会真正随机(Technique 1),LLM 也没有你的品味(Technique 2)。想让模型跳出默认偏好,要么喂外部随机性(随机字符串),要么把具体的狂想写进 prompt。两者都不是模型自己会做的事——它们必须由你带来,否则模型只能回到训练分布的中心。

判断 2:架构里必须有"客观评论员"。让 agent 审视自己没意义(Technique 3)。让另一个 agent 拿着截图打分,把主观判断从 agent 自己的 context 里隔离出来,这是性价比最高的分工——贵的模型只用来做高层判断。评论员的标准要客观、参考图要清楚、停止条件要设好;否则循环要么不收敛,要么烧 token 烧到天亮。

判断 3:交付阶段的减法没人替你做。AI 爱加不爱减(Technique 6)。删是克制也是判断,这一刀必须你来——AI 不爱冒险,而删掉一个组件、删掉一段代码,正好是冒险的事。

剩下两件事属于"工具栈"——Technique 4 的图片生成是把设计从"千篇一律"拉出来的关键拐杖;Technique 5 的视频生成是"想继续滚动"这种产品情感的直接工具。两者都靠"接外部生成 API",要点是别让 agent 局限于代码这一种输出介质。能产图像、产视频,设计的弹药库就大了一轮。

7 个 Technique 是同一个判断的 7 张脸

如果只看具体手法,7 个 Technique 是 7 件独立的事。把它们摆在一起看,Anshu 在讲的就一句话:LLM 默认产出的是"最大公约数"设计,要拿到好的设计必须主动偏离默认值

Technique 1-3 是三种"偏离"路径——从外部注入随机性、自己带品味、把"自己审视自己"换成"别人审视自己"。Technique 4-5 是让设计丰满的拐杖(图像、视频),Technique 6-7 是让设计克制的减法。两组看着像两件事,其实是同一件事的两面:加法是廉价的,减法才是判断。Anshu 没明说,但他整套方法的价值就在这里——3 + 2 + 2 不是并列,是递进。

这也是为什么它不是"AI 设计圣经"。它是一个从 12 年 Apple 研发与设计实践里长出来的约束清单。每个约束都对应一个模型本能的反面:LLM 要稳,你要它变;LLM 要同质化,你要它有性格;LLM 爱加,你要它会减。约束写得越具体,模型能"听懂"的余地就越大。

方法本身不需要每代重写。Anshu 自己说要把"没奏效的 prompt"存下来等新模型再跑——这套方法的天花板是被每一代新模型撑高的;模型在变,约束不变。

出处与延伸阅读

术语使用报告

英文原文中文翻译出现次数一致性
Discover / Define / Deliver探索 / 定义 / 交付各多次
Double Diamond双钻模型1
String Seed of Thought字符串种子思维1
subagent子 agent多次
design critic设计评论员多次
chromakey色键1
video matting视频抠像1
landing page落地页 / 产品落地页多次
next-token predictionnext-token 预测1
LLM / large language modelLLM(大语言模型)各多次
seed string随机字符串多次
UGC adsUGC 广告1
CTAsCTA 按钮1
Codex CLICodex CLI多次
fal.aifal.ai多次✅(保留品牌名)
Seedance 2.5Seedance 2.51✅(保留版本号)
Claude Opus 5 / Fable 5 / GPT-5.6 Sol保留原模型名各 1-2✅(保留版本号与品牌)
Antigravity / Grok Build保留原工具名各 1✅(保留品牌)
AGENTS.md / CLAUDE.md / .env.agents保留文件名多次
R&DR&D(研发)1
moodboardmoodboard(情绪板)1
POCPOC(概念验证页)1
design by committee委员会设计1

总计 23 个主要术语,译法在全文范围内保持一致。

翻译说明

  1. 架构层重写,不是逐句对译:原文是 Anshu 的第一人称叙述 + Lenny 的引子 + 7 个 Technique 的"判断→证据"模式。译文按中文 essay 节奏重组:开篇先抛"1% vs 99%“判断,再讲 LLM 的物理限制,再讲 Apple 12 年的来历,最后进三阶段——读者不需要一段段爬原文。
  2. Technique 3 的工作流 prompt 没硬译成"步骤一/二/三"清单:原文 prompt 是一条用户指令,译文中作为"原文 prompt 例子"以引用块保留原样。硬翻译会让那段指令读起来不像 prompt 而像教程步骤。
  3. 付费墙处理:Technique 7"Remove AI tells"的正文位于 Lenny’s Newsletter 付费墙之后,未对外公开。译文中以**【付费墙】**显式标注,未编造后续内容。
  4. 术语取舍:模型名(Claude Opus 5 / Fable 5 / GPT-5.6 Sol / Seedance 2.5)、工具名(Codex CLI / fal.ai / Codex / Antigravity / Grok Build)、文件名(AGENTS.md / CLAUDE.md / .env.agents)、API key 占位(sk-a1b2c3d4…)全部保留原文。第一性原则:技术名词的"具体性"是信息的一部分,翻译掉会削弱原文判断力。
  5. 方法核心句保留:Anshu 在 Technique 2 结尾那段"如果觉得’肯定没戏’就对了"和"存下没奏效的 prompt 等新模型再跑"是文章的方法论核心,不是装饰。译文原样保留引用,并在结尾复述收束。

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。