市场资讯 09.06 16:47 (来源:量化智投)

Seedance 2.5与Seedream 5.0联动视频创作教程

1.1 Seedance 2.5视频生成模型 1.2 Seedream 5.0图像创作模型 1.3 模型联动视频创作流程 1.3.1 全流程:视频与图片混合迭代 1.3.2 Seedance 2.5|首轮分镜生成 1.3.3 首轮检查与Seedream 5.0介入判断 1.3.4 Seedream 5.0|关键帧图像生成 1.3.5 补充建议与特殊情况提示词 1.3.6 镜头串联、配音字幕与成片

DeepSeek多模态视觉理解模型发布

2.1 API调用:三种传图方式 2.1.1 Base64内联(本地图片最简便) 2.1.2 外部公网 URL(图片已经在网上时最快) 2.1.3 引用通过Files API上传的文件(同一张图反复用时最划算,免费复用) 2.2 清晰度控制与花费 2.3 多模态提示词设计 2.3.1 基本结构:system定角色,user放图文 2.3.2 多图输入 2.3.3 常用视觉任务提示词模板 2.3.4 稳定输出的 4 个技巧 豆包Seedance 2.5与Seedream 5.0联动视频创作教程 Seedance 2.5与Seedream 5.0联动,构建“理解→生图→生视频”全链路。Seedance 2.5为字节跳动新一代视频生成模型,原生单次可生成30秒视频、支持多轮延长,单次最多输入50个多模态参考素材;1080p/720p/480p每秒生成成本约2.7/1.7/0.7元,支持网页版与API调用。Seedream 5.0 Pro为同团队多模态图像创作模型,主打专业商业生产,具备图层拆分、像素级交互编辑、高密度信息图生成与多语种文字渲染等能力。二者均可在火山方舟申请API Key并与DeepSeek串联。 报告以制作国金金融工程团队30秒研究内容短片为例,给出“视频优先、混合迭代”的完整工作流。完整介绍了拆分镜、简化提示词首轮直出、逐镜头检查(中文准确性、字体、场景专业度、结构连贯、Logo合规)、用Seedream生成修复图/关键帧、送回Seedance重生成、最终剪映合成配音字幕的全过程。实践中Seedance文字生成精确度不足,故需借助Seedream锁定静态目标(场景、文字、结构、Logo)后再回滚重生成。报告同时沉淀出回滚修改提示词公式与推荐输出设置,为投研团队自制专业多模态内容提供了可复用的操作范式。 DeepSeek发布实验性多模态视觉理解模型,补齐“看图”能力 8月21日,DeepSeek-V4-Flash-Vision-Exp上线API平台。其纯文本能力与V4-Flash正式版持平,在需视觉理解的Agent Benchmark上大幅跃升,多模态Agent能力已接近Opus-4.8。该模型“只理解不生成”,暂不支持视频等其他模态。与Kimi等“产品/Agent优先”路线模型不同,DeepSeek延续“模型/API优先”的高性价比底座路线;此次同步推出Harness(Agent框架)与Files API,标志其开始补齐工具链一环,向成熟多模态体系靠拢。 API调用简明易用,三种传图方式按场景选择。模型完全兼容OpenAI SDK,仅需将content由字符串改为图文块数组。传图支持Base64内联(本地单图最简便)、外部公网URL(图片已在线时最快)、Files API引用(同图反复使用最划算、可免费复用)三种方式。图片按尺寸折算token计费,单图最高384 tokens,并可通过detail字段(low/high/original/auto)控制清晰度与成本。 模型能力及使用效果受版本迭代影响存在不确定性:DeepSeek-V4-Flash-Vision-Exp为实验性质模型,功能、性能与接口参数可能随时调整或下线;本报告所涉模型评测结果、调用价格与折扣口径均基于特定时点的公开信息,后续可能发生变化。生成式AI存在固有局限,视频与图像生成在文字准确性(存在错别字、乱码风险)、画面结构、Logo一致性与合规性等方面可能不及预期,相关生成内容需人工审核校验后方可使用。使用第三方模型及平台涉及数据安全、隐私保护、内容合规与知识产权风险,实际调用成本亦可能因参数设置、素材规模而波动。本报告所述工作流与提示词方案均基于特定案例的实际使用经验,仅供参考,不构成对任何具体应用场景效果的保证;相关技术应用不构成任何投资建议。

Seedance 2.5与Seedream 5.0联动视频创作教程

1.1 Seedance 2.5视频生成模型 Seedance 2.5是字节跳动于2026年7月31日发布的新一代视频创作模型,延续统一的多模态音视频联合生成架构。单次可原生生成的视频长度提升到30秒并支持多轮延长,单次最多输入50个多模态参考素材(参考图 ≤30、视频 ≤10、音频 ≤10),在长叙事、参考生成、精准编辑与原生出声上全面升级。 模型调用价格上,按照最新的折扣口径,Seedance2.5生成1080p分辨率视频每秒约2.7元(72折计费),同样以官方计算公式,720p分辨率视频每秒生成成本约为1.7元,480p分辨率视频每秒生成成本约为0.7元。 在使用方式上既支持网页版便捷交互使用,也支持API调用: 1) 网页版:a)即梦网页端-视频生成-选择Seedance 2.5;b)豆包专业版-视频生成-选择Seedance 2.5;c)火山方舟体验中心(https://console.volcengine.com/ark)- 体验-选择模型Seedance 2.5。网页版均可在对话框直接设定画面比例、分辨率、视频格式、时长、无/有声、上传参考图/首帧及输入提示词,生成后可在线智能编辑,或多次延长。 2)API(火山方舟 Ark,异步任务):模型ID为doubao-seedance-2-5-260628,支持生成片段时长4–30秒,分辨率支持480p/720p/1080p。 1.2 Seedream 5.0图像创作模型 Seedream 5.0 Pro是字节跳动同一团队于2026年7月8日发布的多模态图像创作模型,主打专业商业生产。相比前代在图文匹配、结构合理性、文字渲染与美感上全面提升,具备图层拆分(将单张图片拆解为底图(1 张)+ 多个图层输出(最多 16 个图层))、像素级交互式编辑(通过坐标、框选、箭头等多种方式指定编辑位置,精准编辑图片)、高密度复杂信息图生成(输入多张参考图片(2-10)+ 文本提示词)、多语种文字渲染与真实商业人像等能力。 使用途径与Seedance相同,网页版三个来源:1)豆包 App/电脑版-AI创作-图片生成-选择模型 Seedream 5.0 Pro;2)即梦网页端-图片生成/Agent模式-选择图片 5.0 Pro;3)火山方舟体验中心-视觉模型-图片生成-Doubao-Seedream-5.0-pro。 同时支持API调用。 以上Seedance和Seedream两个系列模型均可在火山方舟官网(https://console.volcengine.com/ark)申请 API Key,并与DeepSeek等文本/视觉模型串联,形成“看图理解→生图→生视频”的全链路。 1.3 模型联动视频创作流程 此部分以制作国金金融工程团队30s宣传视频为案例展开模型调用、素材准备、分镜镜头划分、提示词设计、分镜视频延长、回滚再生成等的流程讲解。以下均基于实际使用经验,且涉及工具的介入使用,全流程仅供参考。 1.3.1 全流程:视频与图片混合迭代 项目整体流程为: • 拆分镜、设计分镜提示词、查找必要素材图片。 • 设计提示词用Seedance 2.5直接生成分镜镜头,首轮不预设辅助图。 • 逐镜头检查:中文是否正确、字体是否清楚、场景是否专业、结构是否连贯、Logo是否变形。 • 给每个片段定位明确问题,例如“五个关键词字体乱码”、“转场不连贯”等。 • 用Seedream 5.0生成对应修复图或首帧/尾帧图。 • 把修复图与必要的原始参考一起送回Seedance 2.5,重新生成该镜头。 • 镜头全部通过后进入剪映;添加BGM、转场、字幕与文本朗读。 1.3.2 Seedance 2.5|首轮分镜生成 虽然目前Seedance 2.5模型已经支持一次性生成时长为30秒的片段,但根据使用经验,由于分镜表达的主体和内容不同,建议根据内容拆分合理数量的分镜,分别编写提示词。提示词内容可包括:基础图片素材、主场景描述、运镜细节、细分时段切割、色调风格提示及负面提示等。以下为初次简化提示词示例及实现效果。 1)镜头1:城市到紫竹楼体 输入:陆家嘴.jpg、紫竹.jpg|4秒; 以上海陆家嘴高位远景开场,镜头平稳推进并轻微下压;2.6秒后让紫竹楼体成为主视觉,最后0.5秒稳定停留。真实商务建筑、自然金色光、金融机构宣传片质感;不要科幻城市、旋转、冲刺或无关Logo。 2)镜头2:楼体进入AI投研空间 输入:镜头1稳定末帧|6秒; 承接楼体画面,经玻璃反射自然进入真实金融研究空间;依次出现研究屏幕、金融图表、报告和量化模型。末段稳定显示“量化选股、择时、机器学习、资产配置、基金研究”,中文使用微软雅黑,避免游戏UI、赛博朋克和乱码。 3)镜头3:研究材料到成果系统 输入:ppt截图材料,图1–8|10秒 按“材料展示→缩小汇聚到左侧→中间结构整合→右侧形成AI模型与投研成果→放大成果”连续演化。墨蓝与奶油金,少量大标题,避免密集小字和杂乱粒子。不要逐页翻PPT。 4)镜头4:开书、Skills体系与品牌尾板 输入:logo.jpeg|8秒 0–2秒翻开研究手册并露出Logo;2–5秒展示金融投研Skills体系;5–8秒收束到品牌卡和口号。Logo不变形、不重绘;中文统一微软雅黑,专业克制,避免普通PPT感和乱码。 1.3.3 首轮检查与Seedream 5.0介入判断 几个低成本修复原则:一次只处理一个目标——场景、文字、结构或Logo;先用Seedream确定静态目标,再回到Seedance重生成问题镜头;重生成时保持镜头时长与运动路径,重点修正不合格画面。 1.3.4 Seedream 5.0|关键帧图像生成 在首轮视频生成任务检查过程中,我们发现Seedance的文字准确度大约在80%左右,无法做到无错别字不乱码,并且在风格理解和画面布局设计上存在需求理解偏差。因此,定位关键画面后,我们通过Seedream 5.0修正镜头,如:首轮视频中的研究空间场景、材料演化情景,五个投研关键词、skills体系关键词、结尾口号关键词的文字呈现、logo图像确定等。 此处修正首轮视频中的研究空间场景(分镜2)。提示词:生成一张高端金融科技宣传风格的静态画面。场景为数字化金融研究空间,画面中有研究屏幕、金融图表、分析面板、报告界面、数据流和量化模型结构,体现AI正在进入金融研究与投资分析场景。整体风格专业、克制、高级,配色为墨蓝与奶油金,质感干净,具有机构宣传片气质。不要赛博朋克,不要游戏UI,不要夸张粒子特效,不要杂乱,不要水印,不要乱码。 同时确定五个投研关键词的文字呈现(分镜2)。提示词:生成一张高端金融研究数字空间静态图。画面中清晰呈现以下五个短词:量化选股、择时、机器学习、资产配置、基金研究。文字要简洁、清晰、稳定、易读,不要长句。整体风格高级、专业、克制,配色为墨蓝与奶油金,具有金融机构宣传片质感。不要赛博朋克,不要游戏界面,不要过多特效,不要杂乱,不要水印,不要乱码。 随后回到Seedance 2.5,将分镜1稳定末帧与对应参考图一并输入,重新生成镜头2;图1负责修正情景,图2负责锁定关键词画面。 由于首轮视频中的材料演化情景不理想,需要生成辅助图先确定“研究材料汇聚—结构整合—成果升级”的目标画面,再回到Seedance重生成镜头3。 此处修正首轮视频中的材料演化情景(分镜3)。提示词:生成一张高端金融研究宣传风格的主视觉图。画面表现多页PPT、研究报告、流程图和成果页在空间中堆叠、叠加、滑动,并逐步融合成高级图表、AI模型和研究成果展示画面。PPT已发。整体体现“研究材料汇聚、结构整合、成果升级”的感觉。画面中保留少量清晰稳定的大标题,避免密集小字。整体配色采用墨蓝与奶油金,质感高级、专业、克制,像证券研究团队宣传片主视觉。不要卡通,不要赛博朋克,不要游戏UI,不要杂乱,不要夸张粒子,不要乱码,不要水印。 随后回到 Seedance 2.5,输入初始素材图与辅助图3,保持10秒演化节奏,依次呈现材料展示、汇聚、整合、成果形成与放大收束。 此处生成的辅助图4用于确定Skills体系文字,辅助图5用于确保Logo准确,辅助图6用于确定结尾口号文字。 确定Skills体系文字的层级与呈现(分镜4),提示词:生成一张高端金融投研宣传风格的静态画面。画面整体简洁、高级、专业,配色采用墨蓝、奶油金和深蓝灰。画面中清晰稳定地展示以下短词:量化选股、择时、机器学习、资产配置、基金研究、金融投研 Skills 体系、行业投资专家 Agent、AI 自动化因子挖掘、权益基金研究体系、投价报告自动生成。文字要简洁、稳定、易读,排版有层次感,不要长句,不要密集小字,不要杂乱,不要乱码,不要水印。 确定开书画面并确保Logo准确(分镜4),提示词:生成一张高端金融宣传片结尾主视觉图。画面中一本精致的研究手册、书页或正式资料被翻开,其中一页清晰呈现国金证券 logo。整体风格高级、专业、克制,具有证券研究团队宣传片质感。画面配色采用墨蓝、奶油金和深蓝灰,留白得体,质感干净。不要卡通,不要赛博朋克,不要水印,不要乱码,不要杂乱。 确定结尾口号的文字与品牌卡形式(分镜4),提示词:生成一张金融机构宣传片结尾品牌卡。整体风格简洁、高级、专业,配色为墨蓝、奶油金和深蓝灰,具有品牌收束感。画面中清晰展示结尾口号:“以专业驱动研究,以创新引领投研——国金金工”。参考logo可以修改成金色字体/图案,构图平衡,留白适中,适合作为宣传片最后定格画面。不要卡通,不要杂乱,不要乱码,不要水印。 随后回到 Seedance 2.5,同时输入三个辅助图,并明确8秒目标顺序:0–2秒到达图5的开书与Logo画面,2–5秒到达图4的Skills体系画面,5–8秒到达图6的品牌卡。 1.3.5 补充建议与特殊情况提示词 初次使用简单提示词生成分镜初稿后清晰定位问题,进行回滚修改的建议提示词公式:问题描述+目标场景+构图路径+确认文案+微软雅黑要求+配色+限制项。 类似项目中,通常出现场景已满足要求但画面内文字仍不稳定的问题,可为问题镜头生成一张文字目标图。保留现有场景、构图与配色,只呈现需要确认的短句:[确认文案]。所有中文逐字正确,统一使用微软雅黑字体(可替换),字形端正、层级清楚、留白充分;不要艺术字、密集小字、乱码、水印。 若演化路径不清晰,需要先锁定单张结构关键帧。目前Seedance支持使用白模参考、运动参考,更方便的是为问题镜头生成一张结构目标图。按“左侧输入材料—中部整合路径—右侧结果系统”组织空间关系,主体层级清楚,只保留少量大标题;墨蓝与奶油金,专业、克制。所有中文使用微软雅黑字体;不要PPT轮播感、游戏UI、杂乱粒子、乱码或水印。 辅助图送回Seedance 2.5,并在视频提示词中说明它是需要到达的目标关键帧。保持原镜头时长和运动路径,重点描述如何自然进入目标画面并稳定停留;每轮只调整一个核心变量,确认后再处理下一个问题。 1.3.6 镜头串联、配音字幕与成片 Seedance 2.5支持多轮延长,因此在画面主体、画风较为连续的叙述性视频创作过程中,推荐使用该功能。提示词开头可参考:延长视频,衔接@视频 1画面内容和主体继续生成一个30秒的视频,保持人物主体、场景、画面风格、声音音效一致…… 而在本宣传片示例中,实景和虚拟景、PPT素材和特效来回切换,推荐在确定各分镜视频后,运用剪辑软件做简单拼接。在有字幕、配音要求的视频创作中,也更推荐运用剪映等第三方工具添加字幕、从更广泛的风格人声库中生成配音。建议将BGM、文本朗读、字幕与视频分轨管理,便于多次完善视频效果。 导出前检查八项:镜头顺序正确、所有中文逐字正确、Logo与原始logo一致合规(无变形、重绘或无关品牌)、场景专业克制、结构演化方向清楚、旁白、字幕与画面同步、BGM不压人声、输出分辨率、帧率、码率确定。

DeepSeek多模态视觉理解模型发布

8月21日,DeepSeek全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线其API平台,作为实验性质模型。其纯文本能力(Agent、推理、世界知识等)与DeepSeek-V4-Flash正式版持平,并在需要视觉理解的Agent Benchmark上相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。 与Kimi K3等原生多模态(文字、图片、视频在同一个模型里被统一理解)模型不同,DeepSeek-V4-Flash-Vision-Exp补上了模型的看图能力,但只理解不生成,视频等其他模态也不在其理解范围内。在产品定位上,Kimi的“产品/Agent”优先路线把模型包装成一个带内置工具(联网搜索、文件解析、代码执行、幻灯片渲染与导出)的长上下文助手;而DeepSeek一直以来的“模型/API”优先路线则提供极具性价比的强底座,把工具链和产品化留给开发者自己去搭。值得注意的是,这一格局正在改变:vision-exp上线伴随着DeepSeek同步推出的Harness(Agent 框架)与Files API,这标志着它也开始补齐“工具链/Agent”这一环,逐渐向成熟多模态靠近。 2.1 API调用:三种传图方式 DeepSeek-Vision-Exp也完全兼容OpenAI SDK,base_url不变。核心区别只有一点:带图片时,content不再是一段字符串,而是一个块数组,拼接文本与图片。 其中图片有三种传入方式,按场景选择。 2.1.1 Base64内联(本地图片最简便) 把本地图片编码成data:URL直接塞进请求,这是本地文件最简单的方式。适合一张图、问一次。内联图片会计入48 MiB请求体上限;单图最大32MiB。 2.1.2 外部公网 URL(图片已经在网上时最快) 传入一个可公开访问的http(s)链接,模型会自动下载图片。URL最长8192 字符、图片≤32 MiB、需60秒内下载完成。 2.1.3 引用通过Files API上传的文件(同一张图反复用时最划算,免费复用) 通过Files API上传一次图片拿到file_id(形如file-api-xxx),之后多次请求直接引用,不必重复上传。单文件可达64MiB(超过内联32MiB上限时也只能走这条路)。 2.2 清晰度控制与花费 对于前两种方式的image_url输入,可以进一步选填细节级别detail字段来控制图片处理方式,例如:{"type":"image_url","image_url":{"url":"…","detail":"original"}。 具体费用上,图片按尺寸换算成 token,与文本token一起计费;每张图最高384 tokens,价格按V4-Flash标准。 缩放规则上,小于约384×384的图会等比放大;更大的图等比缩小到约800×800的总像素。所以2000×2000和5000×5000消耗的token相同。 2.3 多模态提示词设计 多模态提示词 = 角色设定(system)+ 图文混排的任务(user)。掌握下面几点,效果会稳定很多。 2.3.1 基本结构:system定角色,user放图文 需要注意的是,图片只能出现在user消息里,放进system或assistant会报400错误。 文字块和图片块的顺序上,一般把文字说明放前面,让模型先知道要干什么再看图。需要模型逐图处理时,可以「文字→图A→文字→图B」交替排列,用文字给每张图打标签。 2.3.2 多图输入 一个user消息里放多张图,单请求最多 600 张图,≥15 张图时单边尺寸自动降到4096 像素。 2.3.3 常用视觉任务提示词模板 2.3.4 稳定输出的 4 个技巧 1)明确产物格式:要Markdown格式需说明,要JSON就给字段名,避免模型自由发挥。 2)分点提要求:用1) 2) 3)列清楚,比一大段话更可控。 3)约束边界:如“40字以内”、如“只输出规定格式的回答本身,不要解释”。 4)细节任务用detail:"high",识别人脸、小字、表格数字时必须调高至high。

1. 模型能力及使用效果受版本迭代影响存在不确定性:DeepSeek-V4-Flash-Vision-Exp为实验性质模型,功能、性能与接口参数可能随时调整或下线;本报告所涉模型评测结果、调用价格与折扣口径均基于特定时点的公开信息,后续可能发生变化。

2. 生成式AI存在固有局限,视频与图像生成在文字准确性(存在错别字、乱码风险)、画面结构、Logo一致性与合规性等方面可能不及预期,相关生成内容需人工审核校验后方可使用。

3. 使用第三方模型及平台涉及数据安全、隐私保护、内容合规与知识产权风险,实际调用成本亦可能因参数设置、素材规模而波动。

本报告所述工作流与提示词方案均基于特定案例的实际使用经验,仅供参考,不构成对任何具体应用场景效果的保证;相关技术应用不构成任何投资建议。 证券研究报告:《大模型赋能投研之二十九: 金融场景AI视频生成实战:Seedance 2.5模型使用指南》 对外发布时间:2026年8月23日 报告发布机构:国金证券股份有限公司 证券分析师:高智威 SAC执业编号:S1130522110003 邮箱:gaozhiw@gjzq.com.cn

本文作者:市场资讯