亚马逊主图视频我用 AI 一键做了:实测记录
去年给一款折叠无线充电支架拍主图视频,我找的拍摄工作室报价 3800 元,排期两周后才开机。样片回来我觉得第二镜没交代清楚折叠动作,改一版分镜又补了五天。等视频上线,同款竞品已经降过一轮价,那波流量我一点没吃到。
今年这个 SKU 要上新配色,我改成用 AI 跑。整条流程压到了一次提交:传一张商品原图、填四行商品卖点、选「产品演示」类型、定好模型时长比例,然后等出片。这篇把我实际填的参数、花掉的点数和翻掉的两版都记下来。

产品全景画面:四分之三侧视角、纯净渐变背景、产品占据画面中心主要面积。产品演示视频的开场必须让观众在 2 秒内判断出品类,这是第一类必备画面的标准长相。
第一版就翻了:我拿种草视频的思路做主图视频
我第一版是照着自己那条 TikTok 种草视频的感觉写的卖点文案,重点全放在「谁在用、为什么值得买」上。
出来的片子里模特占了画面主体,商品被推到右下角,全局灰调平光,铰链和接口完全看不清。这条片子放 TikTok 是成立的,传到亚马逊主图位就等于没有交代产品。
我这才把两件事分清楚:演示视频回答「这是什么、怎么用」,带货视频回答「你为什么现在要买」。
演示视频的镜头语言是功能展示、细节特写、使用过程,画面里商品始终是主体,不需要口播钩子。带货视频靠前 3 秒的钩子留人,商品可以晚一点出现。
亚马逊主图视频、详情页视频、独立站产品页视频走的都是演示路线;TikTok、抖音信息流里的种草视频走的是带货路线。参数也相反——演示视频 16:9 横版不出人,带货视频 9:16 竖版靠人物撑。

错误示范:模特占据画面主体、商品被推到右下角只占很小面积、全局灰调平光、背景杂乱,商品的结构细节完全看不清。这种画面在带货视频里成立,放进主图视频位就等于没有交代产品。
亚马逊的四条硬要求,我是踩过才去查的
格式要 MP4 或 MOV,分辨率不低于 1280×720,推荐 1920×1080。
主图视频位用 16:9 横版,时长控制在 30 秒以内。
画面里不能出现价格、促销信息、外部网址、联系方式和竞品对比,也不能用「最好」「第一」这类绝对化用语,口播和字幕一样算。
商品详情页的视频位需要品牌备案(Brand Registry)之后才开放。我另一个没备案的号试过,主图位根本传不上去,只能走 A+ 页面。
我实际填进去的那四行
输入框要的是商品事实,不是分镜脚本。我填的是这四行:
商品:可折叠桌面无线充电手机支架
核心卖点:铝合金机身,折叠后厚度 1.8cm,15W 无线快充,支撑角度可调
适用人群:办公室白领、居家办公人群、经常出差的商务人士
使用场景:办公桌上边充电边看会议、出差时收进电脑包带走
核心卖点我第一版写的是「做工精良、质感出色」,出片后画面干净但什么也没交代。换成「折叠后厚度 1.8cm」这种能被渲染成画面的物理特征,第二版立刻出了收拢状态的实拍感镜头。
使用场景决定成片环境。我一开始写了「办公室、咖啡厅、高铁上」三个场景,成片十几秒里换了三个房间,看着像旅游 vlog。删到只留办公桌一个环境之后才稳。
成本我算了一遍:30 秒 1500 点,15 秒 300 点
模型决定时长上限和单价,得先选模型再拉时长。我用的是电商 AI 视觉工具 PixGT,几款模型的价目是这样:
Seedance 2.5:50 点/秒,单段最长 30 秒,长叙事强参考,接近真实拍摄质感
Seedance 2.0:30 点/秒,单段最长 15 秒,影视级质感,原生音画同出
Seedance 2.0 Fast:25 点/秒,单段最长 15 秒,生成更快,兼顾成本与质量
Seedance 2.0 Mini:20 点/秒,单段最长 15 秒,高性价比,适合批量生产
MiniMax H3:20 点/秒,单段最长 15 秒,自带立体声配音,可选 2K 高清
亚马逊要求 30 秒以内,而 30 秒正好是 Seedance 2.5 的单段上限,一条完整主图视频能一次出完,不用分段拼接,折算 1500 点。
我实际上没跑满 30 秒。先用 Seedance 2.0 Mini 跑 15 秒试水,一条 300 点,连翻两版重跑也才 900 点,比工作室 3800 元的报价差着量级。定稿那条才切回 Seedance 2.5。
比例固定选 16:9,别用「智能」让系统自己判断。清晰度 720P 已经过了亚马逊 1280×720 的下限;想接近推荐的 1920×1080,「自动超清 2x」加 10 点做超分,失败会自动退还。

结构展开画面:手部正在把支架从收拢状态掰开,铰链和支撑臂的转动过程清晰可见。演示视频的第二类必备画面回答「它怎么打开」,画面里要同时出现手和正在形变的结构。
第二版翻在漏镜:我列了五条验收清单
系统自动拆的分镜不是次次都齐。我第二版就漏了结构展开这一镜——一款主打折叠的支架,成片里从头到尾没打开过。
后来我固定按五类画面验收,每条对不上就回去改文案重跑:
产品全景:回答「这是什么品类」。缺了观众前几秒认不出商品
结构展开:回答「它怎么变形、怎么打开」。缺了可折叠类商品的核心卖点没交代
细节特写:回答「做工和材质如何」。缺了页面上的材质描述没有画面支撑
使用过程:回答「实际怎么用」。缺了买家不确定自己的场景能不能用
尺寸参照:回答「有多大、好不好收纳」。缺了尺寸预期偏差,退货率上升
功能型商品五类都要;纯外观型商品(装饰品、服饰配件)可以少掉结构展开。
缺哪一类就把对应的事实补进那四行卖点再重跑。我补的是「折叠后厚度 1.8cm」和「出差时收进电脑包带走」,第三版结构展开和尺寸参照就都出来了。改文案比改参数有效,因为分镜是从商品事实推出来的。
PixGT 的生成结果区按提交时间倒序排,每条成片都标着所用模型、比例和时长,我来回重跑对比时不用自己记参数。

使用过程画面:手机已放在支架上竖屏充电,一只手刚离开,桌面环境交代了实际使用场合。使用过程画面的合格标准是一眼看懂怎么用,不需要文字说明。

尺寸参照画面:折叠收拢后的支架平放,旁边并排一支钢笔作参照,厚度一目了然。尺寸参照画面替代了详情页里的尺寸标注图,是与退货率最相关的一类。
一定要人工过的一关:尺寸和材质
AI 生成的画面会把尺寸关系画得比实物更讨喜。我那条尺寸参照镜里钢笔和支架的比例,拿实物量过之后发现支架被画大了一圈,重跑才对上。
阳极氧化、磨砂、哑光这三类表面的还原偏差最大,生成结果经常偏亮。我这款是深空灰阳极氧化,第一版出来接近浅银色,色差肉眼可见。
尺寸标注和材质描述如果和实物不符,触发的是商品信息不符判定,比画面不好看严重得多。核对实物这一关没有任何工具能替代,我每版都是自己拿卡尺和实物比过才定稿。
这一轮花了多少、省了多少
试水加翻车重跑一共 900 点,定稿那条 Seedance 2.5 的 30 秒版 1500 点,全程 2400 点,从写卖点到拿到定稿花了不到一个下午。
去年同一件事是 3800 元加三周多。今年这一轮下来,主图视频对我来说从「要不要做」变成了「哪个 SKU 先做」——一条 15 秒短版 300 点,试错成本低到每个 SKU 都能先出一版再挑。
要提醒的是,AI 出的片子不等于能直接上传。尺寸、材质、绝对化用语、AI 生成标识这四项还是得自己逐条过,翻车基本都翻在这里,不在生成本身。
作者提示含AI生成内容。
