2023 年初王长虎准备创业时,一些投资人见到他的第一反应不是讨论技术,而是觉得他"不够年轻"——当时 AI 创业最受关注的是大语言模型,投资人普遍认为 35 岁以下的年轻创始人学得更快。三年后,他创办的爱诗科技(PixVerse)拥有超过 1.5 亿注册用户、1500 万月活,覆盖 177 个以上国家和地区,C 轮融资总额 4.39 亿美元、估值超 20 亿美元。这个"被认为太老"的创始人,做对了什么?
先看履历。王长虎在计算机视觉领域做了近 20 年:中科大博士毕业后在微软亚洲研究院工作 13 年,2017 年加入字节跳动组建 AI Lab 视觉技术团队,担任集团视觉技术负责人,参与抖音和 TikTok 早期视觉技术体系建设。简单说,他过去的工作是让机器"看懂视频"——一段视频里有什么人、人在做什么、镜头如何移动、用户为什么停留或划走,这些都要被机器识别,才能用于推荐、搜索、审核和广告。另一位联合创始人谢旭璋是 90 后,北大光华毕业,在光源资本做了 6 年投资,长期研究公司和商业机会。两人有个共同点:此前都没完整操盘过面向普通用户的消费产品。

所有人都在做大语言模型,他们选了视频
爱诗科技 2023 年 4 月成立,起初并没有立刻确定做视频生成——当时最热的是 ChatGPT,创业者集中在聊天机器人、办公工具和大语言模型。直到 2023 年 6 月核心团队到位,王长虎决定把资源全部投入视频生成,原因并不复杂:大语言模型已经聚集了大量公司,AI 绘画有 Midjourney 和 Stable Diffusion,但视频生成难度更大——需要同时处理人物、物体、动作、镜头、光线和前后画面的一致性——真正投入的团队反而不多,而且这与他的经历高度匹配。仅仅四个月后完成第一代视频生成模型;2024 年 1 月海外产品 PixVerse 上线,88 天用户累计生成 1000 万条视频。
但这个阶段的 PixVerse 仍是典型的 AI 生成工具:用户写提示词、等待、在几次结果里挑一个勉强可用的版本。对专业创作者可以接受,对普通人太麻烦——没人愿意为一条几秒的视频反复改提示词、等几分钟、试五六次。PixVerse 真正跑出来,靠的不是给用户增加参数,而是把这些参数全部藏了起来。

不用写提示词,直接上传一张照片
现在打开 PixVerse,普通用户最容易理解的功能不是文生视频,而是各种视频模板:上传一张自己、朋友或宠物的照片,选一个模板,照片里的人就能变成美人鱼、超级英雄、玩具手办,或者让宠物跳舞。整个过程不需要写提示词,也不需要理解模型。

它和短视频软件的传统特效看起来相似,但生产方式不同:传统特效需要设计师和工程师针对一个效果单独制作,换一个动作或场景就要重新调整;PixVerse 的模板建立在视频生成模型上——模型先理解照片中的主体,再重新生成完整的动作和变化过程,同一套生成能力可以封装成不同模板、适应不同人物和图片。对普通用户来说,这把一个开放式创作问题变成了选择题:上传照片、挑效果、等几秒、分享到 TikTok 或 Instagram。这个改动看似不复杂,却改变了用户群——过去 AI 视频工具服务的是愿意研究提示词的创作者,模板出现后,任何有一张照片的人都能用。
第一次大规模破圈,靠"毒液变身"
2024 年 10 月,PixVerse 发布 V3 模型。此前 AI 视频生成很像"抽卡":同一提示词生成五次可能只有一次能用,人物的脸会变、手脚会错位、动作做到一半消失。V3 首先解决生成成功率——按王长虎的说法,在特定模板场景中把过去很低的成功率提升到接近 100%。随后上线的"毒液变身"等模板开始在 TikTok、Instagram 传播,全网累计播放量超过 10 亿次,仅这个阶段的变身特效就带来约 1000 万新增用户。2024 年 12 月的 V3.5 把生成时间从分钟级压缩到 10 秒以内,随后推出移动端 App。生成成功率解决"能不能用",生成速度解决"愿不愿意等",模板解决"普通人知不知道该做什么"——三个条件同时满足,PixVerse 才从模型演示工具变成消费产品。

从字节迁移过来的不是数据,是"怎么看视频"
有一个特别容易被忽略的能力:数据标注。谢旭璋认为视频数据本身并不稀缺,网上到处都是,难的是准确描述一段视频里发生了什么。这里的迁移并不是把抖音或 TikTok 的数据带到新公司,而是带出了一套理解视频的方法:推荐系统要把正确的视频推给用户,需要"看懂"视频——不能只知道画面里有只猫,还要理解猫在奔跑还是睡觉、镜头静止还是移动、情绪是搞笑还是紧张、动作在哪一秒开始、用户最可能在哪一秒失去兴趣。视频生成模型同样需要这种理解:如果训练数据只告诉模型"这是一段超级英雄视频",模型很难学会人物如何转身、衣服如何变化、前后动作如何连起来——标签越准确,模型越容易理解"变化发生的过程"。这也是 PixVerse 与单纯采购开源模型再套界面的工具之间的区别:开源模型更新一次,后者的产品能力就可能被洗牌;PixVerse 同时控制底层模型和上层产品,用户在产品里的生成、重试、下载、分享行为又能持续告诉团队哪些效果受欢迎。当然,王长虎也多次强调视频生成的速度和质量来自模型架构、算法、工程优化和产品反馈的共同作用,把它简单归结为"字节有很多视频经验"会低估训练的复杂程度。

从 1200 万到 1.5 亿用户,不到两年
增长轨迹:2024 年 1 月上线,88 天生成 1000 万条视频;2024 年 12 月注册用户超 1200 万、月活近 600 万;2025 年 3 月注册超 4000 万、月活 1500 万;2025 年 5 月超 6000 万;V4.5 上线后一款"咧嘴笑"模板把 PixVerse 推到美国 iOS 下载榜第四;2025 年 8 月突破 1 亿、支持 13 种语言、累计生成超 8 亿条视频;2026 年 7 月注册 1.5 亿、月活超 1500 万。

不到一年做到 4000 万美元年化收入
PixVerse 早期先积累用户,2024 年 11 月才正式商业化。个人用户主要靠订阅和点数付费,不同模型、分辨率、视频长度和是否生成音频消耗不同点数。2025 年 10 月公司披露,PixVerse 与国内版"拍我 AI"的年度经常性收入已超 4000 万美元——从开始收费到这一年,收入增长超过 10 倍,订阅收入已能覆盖绝大部分成本,现金流接近转正。个人订阅之外还有第二种收入:把视频模型卖给企业和开发者。模型分三条产品线:V 系列面向普通用户和 API(文生视频、图生视频、音画同步);C 系列面向影视和商业制作(镜头控制、角色表现、多镜头内容);R 系列面向游戏和"世界模型"(画面根据用户操作持续变化)。图生视频 API 公开价格约每分钟 4.8 美元,领投方阿里已将其视频生成能力部署到相关业务。

融到 4.39 亿美元后,目标移向游戏
融资节奏:2025 年 9 月 6000 万美元 B 轮(阿里领投),一个月后 1 亿元人民币 B+轮;2026 年 3 月约 3 亿美元 C 轮(鼎晖领投,儒意、三七互娱等参与);2026 年 7 月 C 轮扩展使总额达 4.39 亿美元,估值超 20 亿,新投资方包括阿里、蓝色光标、未来资产——覆盖云计算、电商、广告、影视和游戏,基本对应它正在拓展的企业场景。产品方向也在变化:2026 年 1 月发布实时世界模型 R1,生成的不是固定片段而是持续输出的画面,用户在观看中发出新指令,视频跟着变化;三个月后增加共享世界和个人化身,多个用户可同时进入同一生成场景;7 月进一步发布 PixVerse Game Engine,把 R1 用于互动游戏和实时直播——创作者设定规则、角色和结构,模型实时生成画面、动作和环境。

PixVerse 做对的,是把模型指标改成了"用户动作"
"用户思维""用户体验"这些词早被说成陈词滥调,但 AI 时代这种老掉牙的产品思维依旧发挥着巨大作用。很多 AI 视频公司习惯展示分辨率、视频长度、模型参数和排行榜成绩;PixVerse 当然也做这些,但它在消费产品上盯住的是另外几个指标:用户生成一次能不能成功?需要等多久?需不需要学提示词?结果愿不愿意发出去?这几个问题直接决定普通人会不会用。它没有要求所有用户先成为视频创作者——模板降低第一次使用门槛,底层模型保证效果和成功率,TikTok 和 Instagram 负责传播,订阅和点数负责变现,把一家需要大量算力的视频模型公司变成了一款能靠用户作品持续获客的消费产品。
我的总结:这个案例对普通开发者最有价值的不是它的融资规模,而是那组被替换的指标——把"模型多强"换成"用户生成一次能不能成功、等多久、会不会发出去"。任何 AI 产品都适用这套换算:用户不关心你的参数,只关心自己的动作链有多短。变现结构上"个人订阅 + API 分线"的双轨也值得做工具产品的参考,详见独立开发者变现指南。