
塔拉-迈耶
9 月 10, 2026
生成式AI出来后,增长团队做移动广告素材的效率直接翻倍。以前一个新钩子、一段配音、一组画面、一整条广告变体,起码要好几天甚至好几周,现在几分钟就能跑完一轮。
但素材做得再多,也不代表效果就能跟上。AI再厉害,每条变体照样得真金白银地去测,数据也得跑出来才作数。团队手里得有硬指标,才知道这条素材是追投、是改版,还是直接毙掉。
在 最近一期《Tenjin ROI 101》,Roman和Bidmatrix的增长副总裁Mark聊了聊 素材测试 和决策逻辑,到底被生成式AI这个变化冲成了什么样。
"现在不缺想法,缺的是靠谱的决策。"
AI没消除瓶颈,只是把它换了位置
AI还没普及的时候,要搞一轮新素材,通常得找设计师、剪辑师、视频制作人配合,还得排队等排期。
每个素材创意都在争那点有限的时间和人力,团队能做几条、能测几条,天花板就摆在那儿。但 AI工作流一上,这些限制基本就破了。素材团队一天之内就能跑出好几个钩子、不同的视觉风格、配音,连本地化版本也能一并搞定。
Mark觉得,素材产量确实上去了,但瓶颈也跟着换了:
"现在的瓶颈不是做素材,而是判断素材好不好。"
素材生产快了,但测试能力没跟上。预算还是那么多,有意义的结果得靠时间积累,不是每个变体都能攒够数据让你做决定。
素材多了,“测试债”也来了
现在素材出得快、成本也低,团队能试的东西自然就多了。但问题是:怎么从里面挑出值得测的变体,又不把预算和精力摊得太薄?
Mark管这叫"测试债":
"团队一天就能出几十上百个选项,听着挺猛。但问题也跟着来了:素材太多,根本测不过来。预算一摊碎,结果全是噪音,最后冒出来的所谓“赢家”,很可能只是运气好,不是真的能打。"
说白了,“测试债”就是团队能做出来、但没法靠谱评估的那些素材,而且越堆越多。
就算预算再多一点,几千个变体也没法有效测试。每个素材还是得先证明自己有真金白银的价值,才能拿到更多投入。
十个不一样的素材,换个背景色、改行文案、调个视觉细节,立马就变成一百个版本。AI让这些版本做起来很容易,但版本多不代表都值得测。
素材问责,问三个问题就够了
当素材产出的数量已经说明不了什么问题的时候,增长团队就得换一套标准来看表现了。
Mark把这事拆成了三个问题:
- 这条素材到底“承诺”了什么?
- 它吸引来的是什么样的人?
- 这些人留下来了吗?有没有产生价值?
这三个问题,就把每条素材和它带来的用户质量直接挂上了钩。
Mark解释说,这种对下游事件的关注,正是Bidmatrix优化思路的核心:
"我们的优化盯着下游事件走,因为我们真正关心的是素材吸引到人之后发生的事。"
成功不只看点击或安装——一条成功的素材,吸引来的用户实际体验跟素材“承诺”对得上,他们会持续互动、留下来、或者创造经济价值。
AI确实让做吸睛的钩子和抓眼球的概念更容易了,但有的素材可能在漏斗顶部表现很好,可素材跟实际产品体验之间却对不上号。
素材选择循环
Mark把这套素材问责的逻辑,做成了一个可以反复跑的流程,他管它叫“素材选择循环”。
流程是这样的:
Research → Generate hypotheses → Filter → Test → Validate → Scale carefully
"素材能不能活下去,得靠成绩说话。进来的素材不少,但只有真正跑出价值的,才配拿到更多预算。"
团队先研究用户在乎什么,然后把洞察转化成几个清晰的假设。
接着,把那些让人看不懂的、跟品牌不符的、不相干的、或者可能跟产品对不上的想法筛掉。
剩下的素材拿到受控的测试预算。只有团队验证了它的初始吸引力和下游价值之后,才值得给它加钱。
AI可以在每个环节帮上忙:总结用户语言、识别竞品角度、提假设、生成变体、分析结果,但它是来辅助这个流程的,不是来替代它的——目标不是把所有判断都自动化,也不是搞出一个史上最大的素材库。
"AI应该是用来强化这个循环的……目的是更快地从市场里学到东西。"
为什么测试还得人来主导?
AI在研究、构思、生产和素材分析上都挺好用的。但测试和验证这一步,还是得人来盯、人来负责,因为这些环节牵扯到真金白银的预算,而且数据有限,推断出来的结论,背后得有人撑着。
Mark是这么说的:"人的作用在测试和验证阶段最关键,因为这里涉及现实预算和真实的决策。"
AI模型可以总结早期表现数据、找规律、提素材方向,但投放的设置对不对、这条计划值不值得拿更多资源,还是得人来审。
确保钩子和产品对得上
AI在生成那种让人刷到就想停下来看的开场钩子,确实很有一套。但钩子承诺的东西,跟产品实际能不能兑现,还是得人来把关。
核心素材得展示真实的产品体验或者原汁原味的玩法。不然的话,团队很可能把有误导性的"赢家"给放大了——比如那些点击率很高、但拉来的用户很快就流失、把整体单位经济模型拖垮的素材。
选什么样的情感承诺适合产品,人的判断也很关键。AI当然可以给你建议:缓解焦虑、建立信心、制造紧迫感、掌控感……但这些情绪基调得跟应用实际能给到的体验对上才行。
这不是说所有决策都得永远手动。自动化可以在规则定好之后再引入——也就是说,团队先把该检查什么、用什么数据、按什么规则决策都定义清楚。
为什么在AI素材测试里,衡量反而更重要了
AI把素材产能拉上去之后,团队更容易把漏斗顶端的关注度和长期商业价值搞混了。所以衡量不是不重要了,而是更重要了。要准确评估素材,增长团队得把两层表现数据分开看。
素材吸引力
CTR和IPM告诉你素材有没有吸引到注意、有没有带来安装。这几个指标能回答的问题是:
- 钩子有没有让人停下来?
- 用户点了吗?
- 素材转化安装效率高不高?
用户质量
留存率、关键应用内事件、ROAS和LTV告诉你这些用户有没有留下、有没有创造经济价值。这些指标能回答的是:
- 用户跟产品互动了吗?
- 他们二次打开了吗?
- 他们做了有价值的动作吗?
- 这条投放有商业意义吗?
Mark把这些指标分成三组:
"CTR和IPM告诉我们素材有没有吸引到注意、带来安装;留存率告诉我们用户对应用本身感不感兴趣;ROAS和LTV告诉我们这条投放有没有商业意义。"
麻烦的是,吸引力指标总是先出来,而下游的用户质量得过几天甚至几周才能看到;这个时间差会让早期的赢家看起来比实际更有说服力,一不小心就做出了代价很大的放量决策。
"最危险的素材,就是那些看起来赢得太早的。"
AI能快速生成各种戏剧性的、抓眼球的钩子,但也容易做出那种点击便宜、但用户装完就跑的素材。团队产出和测试变体的速度越快,在放量之前就越要严格把关——既要看吸引力,也要看用户质量。Mark的原话是:
"素材得过了这两道关,才能拿到大预算。"
决策引导AI素材测试
生成式AI确实让增长团队能做的素材变多了
但它没有解决对清晰假设、受控测试、可靠衡量和有人拍板的需求。
当每个团队都能产出更多素材的时候,真正的优势在于:你知道什么值得测、什么值得砸钱、什么可以用来指导下一轮素材决策。





















