三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放

时间:2026-08-13人气: 作者: 佚名

这两周,视频模型更新得太疯了。

2.5, H3,Wan 3.0,Flux3,Meta Muse Video ㅤ和Grok  Video,我光是看各种demo就能看到凌晨一两点。每个case都想上手跑一遍总结出提示语方法后再发出来,奈何就算我日更图文和视频都发不完这些。所以我开源了一个AI提示语案例网站,叫.ai。

01|我开源了维护3年的案例库

平时做不完case我都会存到一个飞书知识库,三年了,里面存了上千条AI视频、AI前端、Agent等等生成记录。每一条都带着完整的提示语,带着我当时测试的模型版本,带着当时生成出来的效果。

三年。

这个文档,最早的一条记录是2023年写的。那时候 Gen-2刚出来,我还在为一个4秒的视频开香槟。到今天, 2.5已经能直出30秒的画面了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图1)

当时提示语还很短,像这个视频就一句,风吹动女孩的头发,女孩悲伤地看着前方。

最近这个文档有一个让我越来越焦虑的问题,

每次模型一更新,前面攒的案例就开始大面积失效。不止是AI视频,前阵子流行用Agent测UI生成,过几周转到3D游戏了,再过几周现在又继续卷UI。烧积分测出来的一套方法论,也可以说是Skill,可能半个月就废了。

我就一直在想一个问题,

这些在X上动不动就几十万播放的案例,那些提示语,到底是真的还是假的?

如果是真的,为什么我用同样的提示语,换一个模型跑出来的差距那么大?如果是假的,那我们每天刷到的那些的效果,中间到底经过了多少人工干预,多少剪辑,多少挑帧?

这个问题困扰了我很久。久到我决定不再只是存案例了,我要做一件更较真的事。所以我做了一个网站,.ai。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图2)

我不想做那种追着模型更新吃一波流量的案例合集站,我见过太多这种了,风口来了堆一波内容,风口过了就没人维护了。我想做的就是建一个经过验证,持续迭代,把优秀作者的方法论都总结下来的案例库。

我验证提示语真伪的方法也很朴素,

先把没有提示语的案例全部踢掉,因为你不知道中间掺了多少水。然后拿同一批提示语,在不同模型上跑交叉验证,看看到底是提示语厉害还是只是某个特定模型能力上去了。最后,把那些真正跨模型都能跑通的多个案例,抽象成一个一个的Skill,方便以后不管模型怎么迭代,都能直接调用。

这套方法听起来有点折腾,但我自己就是这么过来的。当初做AI视频做到第一个100万播放量,就是一轮一轮烧积分测出来的。

02|一次性跑几百个AI视频,怎么选性价比最高的

我意识到,这两周狂上新模型是一个绝佳的测试窗口。手里有三年攒的提示语库,眼前有刚发布的新模型,那就干脆做一次系统性的横测,把.ai第一版做起来,用这两周发的模型,跑一波经得起考验的提示词案例,也顺便挑选表现最稳定的模型,毕竟跑AI视频绝对是要尽可能减少积分的消耗。

十万积分,就这么烧出去了。

从首轮136个case里,从720P档位里选了三个价格最接近的模型, 2.0 Fast、 H3、Wan 3.0,API价格分别是0.6元/秒、0.5元/秒、0.6元/秒,选出来表现最稳定且综合成本最划算的一个。

所以接下来就是我们一起拿最近攒的提示语库,逐场景把这三个模型挨个过了一遍。我选了三类提示语来测,覆盖了视频生成里最有区分度的三种输入方式。

03|多素材参考生视频

超级多人来问我要这个Kpop MV的超长提示语,现在也完整上线了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图3)

那我对多素材的定义是除了图片还会有音频、视频的元素。这种场景对模型来说就是,它得理解你给的图风格,还有音频的节奏,如果想要画面卡上点的话,在提示语阶段就要写比较长的提示语,所以对模型的长指令遵循能力也是有要求的。

那如果大家想做出来的MV有一种精准卡点的感觉,我建议可以用AI音乐工具生成固定时间段,再把它作为参考来生成视频,这样效果会比截取一段音频更好。

每个模型都是生成15s,720p的清晰度,提示语用的是一样的,这也是现在内置的流程,通过API调用不同模型,这样也不会受到Agent本身内置的提示语和skill影响。

为了让大家有更沉浸的观看效果,我把三个视频拼在一起了。每个视频都是 15 秒,从上到下分别是 H3, 2.0 fast,Wan 3.0。

首先是H3,刚跑出来时乍一看感觉还挺不错的,风格、动作节奏、卡点、场景都没有任何问题,但中远景镜头出现了人脸变形和五官模糊的感觉。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图4)

接着是 2.0 fast,它人脸是最清晰的,这让整体观感会更舒服,每一个节拍的卡点基本上都对的上,从开头的手部舞蹈动作到最后的挂电话,动作设计是最符合kpop的感觉的。开头还有鱼眼视角和后面的光效转场,这些细节都会让整个成片看起来更加有层次。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图5)

最后Wan 3.0,整体也是不错的,相比H3人脸会更稳定。舞蹈动作除了开头的几个鼓点没有对应的舞蹈动作外,其余的舞蹈动作卡点都能对的上。

04|文生视频

我选的场景是多人打斗、时间倒退和饼干广告。

这个场景我选得比较刻意,就是想把模型逼到极限。打斗考验的是动态生成能力,画面里多个人在打,动作要连贯,力量感要真实。时间倒退更狠,假发要从半空回到男人的头上,这种逆向物理逻辑对模型来说几乎是地狱级的考试。饼干广告就是考审美的,以及模型如何表达水果馅饼干和水果的关系。

而且这组是没有任何图片参考的,纯靠文字描述来驱动画面,做广告的时候靠的就是模型自己的审美。先上打斗,

电影感十足的韩国动作场面:一条狭窄而阳光明亮的城市巷弄,两侧是砖砌建筑、空调外机和堆叠的木托盘,一家醒目的 GS25 便利店坐落其中。一名身材矫健的年轻女子留着金色长发,扎成高马尾。她身穿修身的粉色长袖运动短上衣,下身搭配同色紧身运动裤和干净利落的粉色运动鞋。她的脸庞、颈部和上胸泛着一层细密汗光,显然刚刚结束训练,但神情依旧沉着、专注而坚定。她与一群身穿黑色运动服和连帽衫、来势汹汹的年轻男子正面对峙。没有丝毫迟疑,她猛然冲上前,以精准而强劲的格斗技巧展开反击:快如闪电的拳击、回旋踢、肘击、膝撞、扫腿,以及干净利落的摔投接连使出。她凭借流畅而写实的动作编排,将袭击者逐个击倒。手持摄影机紧贴人物穿行于狭窄巷道之中,通过富有动感的运镜、轻微的镜头晃动、真实的运动模糊和快速切换的视角,强化每一次撞击的力量与紧张感。随着冲突不断升级,众人接连重重摔在路面上,整场打斗在极具电影感的节奏中持续推进。背景里,三名身穿整洁校服的韩国女学生站在 GS25 门口附近,震惊得一言不发,目不转睛地注视着眼前的冲突。明亮的自然日光在砖墙和堆叠的木托盘上投下清晰利落的阴影,也照亮了空气中的尘埃、地面的碎屑以及周围真实细腻的环境细节。最终,最后一名袭击者倒在堆叠的木托盘旁。女子停下脚步,从容地重新调整格斗架势,整理了一下粉色运动短上衣,随后自信地沿着阳光照耀的巷道离去。超写实真人实拍风格,韩国动作电影美学,高强度动作编排,清晰细腻的面部细节,符合真实物理规律的人体运动,电影级手持摄影,自然光效,逼真材质与院线电影级画面品质。

H3在快节奏动作的时候明显整个人是有变糊的情况, 然后整体的打斗感是有的,但是感觉有种对手都站在原地等着被打的感觉。

2.0 fast的打斗感真的很强,从人物出场的对峙,到被打人物撞到空调激起灰尘来体现打击感,中间还穿插了路人的反应,结尾背对人物一个飞踢的动作也很帅,整理衣服的过程也非常干净利索。这里它最值得夸的是知道一场打斗不是两个人在画面中间乱挥手。拳脚碰到人,环境要有反应,周围的人也得知道这里正在打架。灰尘、路人、不同景别和最后整理衣服的收尾都在服务同一段表演,不是单纯靠快切来假装有力量,对手的反应和女主的动作也接得更顺。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图6)

Wan 3.0主要是有点物理bug,人物是穿墙出来的,不过不同景别切换很快能体现出打斗感和力量感。

该图片疑似使用了AI生成技术,请谨慎甄别

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图7)

但是最后的镜头人居然全部消失了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图8)

OKOK,接着就是经典的时间倒退了,这个比上个case的差距就更加明显了,而这里我是把一个30s的提示语压缩成了15s塞给三个模型去跑,看看大家的表现怎么样吧。

写实电影感,白天游乐园过山车。强烈阳光与疾风,轨道和背景呈现真实运动模糊,轻微手持感,细腻肤质,天然胶片颗粒。0-4秒|中景:过山车高速俯冲转弯。前排坐着一名二十岁出头、神情淡定又略显无聊的年轻女子,长发迎风飞舞;身旁是一名戴着逼真假发的中年男人,后排坐着另一名女子。4-7秒|动态跟拍:强风猛地掀飞男人的假发,露出光头。假发旋转着向后飞去,凌乱地罩在后排女子脸上。众人震惊尖叫的瞬间,时间骤然静止,只有前排女子还能活动。7-11秒|缓慢环绕:镜头掠过凝固在空中的发丝、张大嘴的光头男人,以及被假发蒙住脸的后排女子。年轻女子翻了个白眼,无声嘟囔:“靠,又来。”她掏出一片口香糖,拆开、放入口中咀嚼。随后整个世界精准倒放:假发从后排女子脸上飞回,退至刚要脱离男人头顶的瞬间,再次定格。11-13秒|近景:年轻女子取出口香糖,按在男人头顶中央,再把正在翘起的假发用力压回原位、抚平粘牢。她若无其事地坐好,嘴角浮现一丝隐秘笑意。13-15秒|中景:时间恢复正常,过山车继续俯冲。男人摸到假发仍牢牢在位,先是困惑,随即如释重负地笑了。年轻女子目视前方,已经嚼起一片新的口香糖,神情平静而满足。照片级真实,电影级时间连续性,人物外观稳定;精准的风力、头发与假发物理效果;运动模糊仅作用于移动物体;自然电影光影与浓郁胶片颗粒,无畸变、无穿帮,节奏紧凑,具有高重看价值。

H3最明显的就是车没停,虽然是慢速了。然后就是假发飞回来的过程有点奇怪,也许是因为飞回来的轨迹没有按照原轨迹倒回的原因,但是还可以接受。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图9)

不得不说,虽然我在同一个提示语在 2.5 上也跑过,但是2.0 Fast的表现还是蛮吸引我的。

首先就是,它会通过已经是时间停止的画面,再通过镜头的转换,体现出假发倒回和把嚼过的口香糖贴回去这件事情是同时发生的。整体给我的感觉是,虽然说它做了慢镜头,但我能感觉到它是在一瞬间完成这个时间倒退动作的,和我之前用.5做的能有80%的相似度了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图10)

最后就是Wan3.0这回有了大硬伤,没有把车完全停下来,15秒内也没有把假发复原回来。

再就是,经典TVC了,

明亮缤纷的商业广告风格,以水果夹心饼干为绝对主角,呈现草莓、苹果、葡萄和橙子四种口味。饼干与对应水果组成秩序感强烈的几何阵列,画面干净高级,富有鲜明节奏。开场由水果快速聚焦视线,音乐重拍同步切入;随后,不同口味的饼干整齐列队,并迅速切换至产品特写。高潮部分,一块饼干被瞬间掰开,画面随即进入慢动作:水果夹心迸裂流出,饼干碎屑四散飞溅,充分放大馅料的多汁质感与酥脆颗粒的冲击力。随后,多块饼干横向排列,以富有节奏的抛物线轨迹腾空翻飞,突出产品整齐有序的视觉美感与丰富多样的口味。紧接着,剪辑重新加速。结尾处,英文文案“One bite of crispness, a heart full of delight”伴随强烈节拍逐词快速出现,文字动效与产品定格画面精准配合。最终以具有品牌感的画面收尾:饼干与水果由中心向四周放射展开,营造年轻、活力、美味又让人忍不住分享的广告氛围。

那首先,我觉得H3做了一个水果和饼干长龙的拼接效果,是挺好看的。 水果掉落飞溅的水珠、饼干炸开的碎屑、水果馅拉丝、水果饼干排队,最后是画面结尾的广告语,动态画面设计能力确实不错 。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图11)

2.0 fast 整体的完成度也很不错,整个片子是可以拿来用的程度,拉丝的果酱看起来最真实,结尾还采用了悬浮的效果来制作饼干跟水果之间的切换,尤其是那个饼干反转变换成水果的效果,酷酷酷。如果我要把四种口味批量做成一套视频,2.0 fast这种比较稳定的产品主体和快速迭代依然会是我的第一选择。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图12)

再一个Wan 3.0,我就很喜欢它做这个饼干,看起来就比一般的水果饼干要好吃不少,而且他抛饼干跟水果抛上去,再落下来的物理曲线都给人感觉挺真实的, ㅤ就是中间掰开饼干,果酱有点果汁感,横截面也有点不一致了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图13)

05|图生视频

这part我选了一个第一人称vlog。

这个场景在量产里出现的频率太高了。做电商的需要人物vlog视角的产品展示,而人脸,是所有视频生成模型最容易崩的地方。眼睛歪了,嘴角抽了,肤质变塑料了,这些问题在15秒的视频里只要出现一帧,整条就废了。

我用的好朋友@的提示语,在x上20万播放被每日脚本收录进去了。

因为我没有原来的提示词里的参考角色。所以我从视频里截取了两帧,一帧能看清脸部细节,另一帧能看到完整的体态。然后,还是用收藏的角色身份固定参考图表+GPT ,生成了一张参考图,好让后面的模型能用这张图来生成视频。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图14)

生成出来的角色图长这样,表情矩阵、三视图、不同角度的头部,以及五官细节和色卡都出来了。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图15)

顺便提一下,在收录case的同时,还会分析目前这个提示语跟库里面其他提示语的不同点,以及怎么样把它改为我们自己的题材。还有就是用其他模型去运行这个提示语的时候,哪一个步骤是容易翻车的?

这样一来会构成最终的两个判断,

1.把它跑成一个合理的成片,成本是中高低?2.稳定度又是百分之多少?

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图16)

所以来吧,看看三个模型在第一人称vlog上的表现,

一段写实的 15 秒手持旅行 Vlog,由朋友跟随主角拍摄。使用参考图片中的女性作为主角。在整个视频中,始终保持她的面部身份、发型、五官特征和身材比例完全一致。画面呈现真实的智能手机或微单相机质感,采用自然的手持运镜、随意的构图、轻微的人为抖动,以及没有表演痕迹的自然行为。0-3 秒:清晨出发。她背着一个小背包离开温馨的公寓,查看手机,对镜头微笑,整理头发,然后走进阳光明亮的社区街道。镜头从她身后近距离跟拍。3-7 秒:探索城市。她穿过热闹的本地街道,在一家小咖啡馆买了一杯饮品,短暂看向镜头,并自然地笑起来。画面快速、连贯地带过街边市场和小商店。7-12 秒:抵达海边。她来到一座海滨小镇,看见大海。海风吹动她的头发,她兴奋地走向海边,捡起一枚贝壳,然后回头对镜头露出真诚的微笑。12-15 秒:黄金时刻收尾。她手里拿着饮品,坐在海边观看日落。镜头缓慢向后移动,逐渐展现沙滩、海浪和温暖的傍晚光线,营造一段宁静、私人的旅行回忆。视觉风格:真实自然的日常旅行 Vlog,具有纪录片式写实感、自然光线、即兴的人物反应和连贯合理的镜头切换,同时始终保持人物身份一致。不要商业广告式的电影感,不要刻意表演,不要夸张摆拍,不要生硬或人工化的转场,不要文字叠加,不要 Logo,不要改变面部,也不要改变人物身份。

这可能就是15秒的时间有点太赶了。H3特别是在拿奶茶那一段,左回一下头,紧接着又回一下头,然后就下一个画面了,总感觉这些动作都没有做完就已经结束,就老感觉少了些啥。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图17)

然后就是人脸方面,仔细看前后有些不一致,而且皮肤质感还是有些AI。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图18)

2.0 fast的话,整体完整度很高,挑不出特别的毛病,从公寓、街道、水果摊到海边,人物的脸、气质和整条片子的手持纪录感都没有明显断掉,尤其这个笑容还挺甜的。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图19)

然后就是片段中间有个水果摊的空镜,恰好让旅行路线更像真实生活,不是全部镜头都是人物走动,那对于vlog来说就有点太呆了,ps最后12秒的海边日落也是挺漂亮的。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图20)

Wan 3.0整体的画面是没什么问题,但是这个配乐有点像两段音乐掺在一起的感觉有点乱七八糟的,那要想不抽卡来解决这个问题,最直接的就是剪辑软件分离音频替换掉了,虽说不算特别麻烦,但工作流里也确实是多了一个步骤。

讲道理,之前我还做过那个百cases横测(之前我们叫百镜系列),或者说是各种各样模型的横向对比。

但每一次我比较可惜的是,这些提示语共通的优秀方法或者说结构或者说描述画面的方式都没有存下来。这就导致了现在有一些生成的画面,我可能会因为某几个字反复打磨半小时、甚至更长时间。

所以里有我非常喜欢的一个步骤,

就是当同一种case或者同一个作者的同一个case做得比较多的时候,目前会先做一个硬性设定,只要超过5 个,我就会尝试把它做成一个skill。后面我肯定会持续迭代这一套算法。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图21)

像是这个角色设定skill里面就参考了8个作者的10个案例,能直接加载到CodeX里面,让根据这个skill去生成对应的角色,就像这个角色就是我用这个skill生成的。

这个封装了我3年实测经验的AI提示词案例网站,今天正式免费开放(图22)

06|写在最后

三组跑完了,我觉得在综合性能上, 2.0 fast的综合能力更均衡,每个场景都没出大问题,确实会是我跑各种case的第一选择。

我这里的均衡,指的是它在八个完全不同的case里,几乎没有一项出现这个模型根本不适合做的大问题。

多素材K-POP MV里,它的人脸、卡点和动作设计最平衡。多人打斗里,它的力量感、环境反应和动作连贯都在。时间倒退那条,它用15秒保住了最难的因果链,效果已经能接近我之前在2.5上跑的版本。饼干和饮料广告里,它会组织产品和卖点。二维PV它不如H3惊艳,却守住了风格限制。Vlog和人脸特写里,它不一定每一帧都拿第一,但完整度和情绪指令执行没掉队。

这才是我看重的东西。

一个模型偶尔能生成一条最炸的视频,和它适不适合成为量产工作流的第一个节点,是两个问题。

工作室每天要跑的不会只是二维PV,也不会只是人脸特写。今天是广告,明天是MV,下午客户又改了个产品包装。这种时候,模型能不能让你直接开工,比它的某个上限demo有多炸更重要。

所以我会把 2.0 fast当成默认选项。fast速度快,成本低,综合能力不出错,很适合批量产出。我们可以先用它跑出可交付的版本再去看看是不是需要进一步优化。

然后H3的话我会更推荐像之前我们说过的,在创意类型视频或者在和二维动画结合的方向去使用,效果是真的不错,也建议优先使用768P低清晰度下先看看提示语效果,没问题了之后再去跑2K。

Wan 3.0的综合能力其实也不错,而且现在能直出30秒的视频,但问题就是最近模型通道比较拥挤,经常排不上号,我都是凌晨跑的。

最后,这里还有一个特别容易被忽略的东西,就是抽卡率。

做量产的人听到这三个字应该特别有感触。API价格只是纸面上的数字,真正决定成本的是,你平均要生成几次才能出一条能用的。如果一个模型单价0.5元一秒,但平均要抽5次才能出一条合格的,2.0 fast在这8个case里面平均抽卡次数四舍五入是2次,后面我也会统计在200条cases的平均抽卡次数。

OK,回到最开始那个问题。

那些在社交媒体上大受欢迎的案例,提示语到底是真的还是假的?

跑完这十万积分的测试,我现在就可以说一句,

大部分是真的。

但在不同模型上的表现差距真的很大,真的不代表能直接拿来用。

这也是我为什么要做的原因。

就是为了告诉所有人,这个案例在哪个模型上是真的,在什么参数设置下能复现,换到另一个模型上,你又需要怎么调整。

我一直觉得,选模型这件事没有标准答案,只有适合自己场景的最优解。但找到最优解这件事本身,是需要有人去烧积分、去跑测试、去把数据摊开来看的。

三年了。

从一个飞书文档,到一个经过验证的实战案例库。

从存案例,到验证案例,到把案例抽象成Skill。

这件事我觉得值得一直做下去。

好的案例,好的提示语,好的方法论,如果不去验证、不去整理、不去跨模型交叉测试,它们就只是我们信息流里一闪而过的碎片。

我想把这些碎片,

变成能留下来的东西。

最后的最后,

这篇文章里所有的提示语和对比视频,

我都整理好了,

在就能看到。

@ 作者 / 卡尔 & 阿汤