企业业务端工作流与应用模块构建
基于画布或 ComfyUI 平台,为公司业务端独立开发多条落地工作流模板。将复杂的 AI 模型链条封装为高稳定性、高可用性的企业级应用模块,涵盖“去除 AI 感”、“一键电商与广告片生成”、“数字人工作流”、“长视频破限”及“GGUF量化模型本地部署”等多个核心技术应用方向。
基于画布或 ComfyUI 平台,为公司业务端独立开发多条落地工作流模板。将复杂的 AI 模型链条封装为高稳定性、高可用性的企业级应用模块,涵盖“去除 AI 感”、“一键电商与广告片生成”、“数字人工作流”、“长视频破限”及“GGUF量化模型本地部署”等多个核心技术应用方向。
大模型的世界如同一片大海,随其发展愈发壮阔,但每个人所爱各异,选择亦是艰难。固定化的模板便是最好的航标,助用户稳定取出自己最喜欢的那一捧(三千弱水,只取一瓢饮)。
工作流模板不仅是提高用户创作效率与降低使用门槛的方法,也是对抗大模型输出不确定性的有效手段。通过严格的规则与链式多Agent协同,可以稳定高效输出高质量内容。
在单个Agent制作上,通过固定系统提示词与模板化对话,确保每一次交互前缀完全一致,可以大幅提高缓存命中率,从而降低调用的算力成本。
核心提效: 规则化与标准化。
模板制作流程:
1. 了解需求与基本使用规范
2. 样例视频结构与文案拆解
3. 模型边界与提示词格式选用
4. 构建创意/生成/优化Agent结构
自动化模板最基本要求是垂类效果可以稳定复现。固定主要与子Agent提示词结构,不仅方便问题排查与优化,也利于批量构建Agent系统。
工作流设计特殊注意点:必须严格禁止图像比例失真,防止模型生成出现逻辑穿帮,注重多终端视觉还原的一致性。
FLAGSHIP AGENT WORKFLOW // 00
依据企业级无限画布平台打造的多Agent车评视频自动化生成系统。用户只需输入汽车关键视角与细节图片,即可通过 6 个专业 Agent 串联自动生成包含 180s 黄金转化漏斗文案、分镜时间格子、场景/角色/车型视觉锚定图与动态视频 Prompt 的全套 3 分钟车评素材。
💡 点击上方缩略图可查看高清工作流节点架构图。包含总导演控制节点、物理时间格子提取节点、锚定图提示词分支及动态Prompt优化链条。
依据当前公司的无限画布平台制作能一键生成 3 分钟的车评视频。
用户只需要输入汽车关键视角和关键细节的图片,经过工作流运行,可以生成一整套配有完整口播文案的 3 分钟视频的所有素材。因为没有辅助剪辑的功能点,最终需要人为轻量性的介入,进行二次拼贴。
1. 素材资产库缺失,Agent 无法动态调用汽车图片素材 ID。只能固定的将一批素材投递给 LLM、图像、视频模型。
→ 造成的问题:汽车部分细节无法被正确展示
2. 没有共享记忆节点,造成上下流程下的 LLM 记忆断层
3. 没有自动剪辑,只能做剪辑的拼贴
1. 总导演 Agent (General Director)
职责:负责全片的宏观统筹与基调奠定。它会审查用户输入,应用“反差吐槽拉扯”、“钱包共情”等核心创意机制。它严格限制全局只能出现 3 个静态锚点场景(禁止动态行驶道路作为主场景),并确保整体叙事符合 180s 的黄金转化漏斗模型。
2. 关键美术 Agent (Key Art)
职责:负责场景的“视觉包装”。它接过前置的总导演场景锚定,分别设计3个关键场景。包括明确每个画面的场地环境、时段(清晨/深夜等)、昼夜属性以及影调色彩(冷暖对比、饱和度),确保最终画面的美术以及保证整个视频的主场景一致。
3. 大纲拆分 Agent (Outline Splitting)
职责:进行信息结构的重组与上下文的连接。它承接总导演的战略,将繁杂的车评信息拆解并组装成符合标准的 7 幕结构。其最重要的动作是确保前一幕与后一幕之间的上下文逻辑平滑过渡,避免生硬的话题跳转,为下游的细节生成搭建一个连贯的故事骨架。
4. 脚本生成 Agent (Script Generation)
职责:这是整个流转中最关键的“物理对齐”环节。它的核心任务是提取一个一个特定时间段的“时间格子”(如 15s积木块),并向这些时间格子里精准填充内容。它必须确保在这个特定的时间格子里,口播字数不超标(例如 15s 不能超过 67 字),同时剥离所有微观动作指令和特效花字,并将不适合当前场景的画面(如地库测试)精准放入 B-roll(穿插空镜)的格子里。
5. 场景、角色、汽车锚定图生成 Agent (Anchor Image Generation)
职责:负责“防对号入座”与“视觉连贯性锁定”。它基于场景规划和美术设定,为全片的 3 个核心大场景、主讲人特征、车型特征,生成精准的静态锚定图(参考图)提示词。这确保了整个视频在生成长视频时,主讲人服装统一,车型不变,场景光影不出戏。
6. 动态提示词优化 Agent (Dynamic Prompt Optimization)
职责:优化单个时间格子内的脚本动态提示词。它会给之前的画面加上具体的微观动作(例如“右手捏着杯子”)、微表情变化、以及符合物理规律的运镜方式,产出最终可以用来抽卡的 Prompt。
上下文割裂和上下文爆炸问题:
由于缺失记忆功能,将上游输出完整给到下游,并让下游 agent 主动提取部分上游的概述,利用 LLM 自身能力完成上下文的压缩和信息传递。
由于不具备上下文压缩功能和 items 拆分功能,上游的输出 + 系统提示词 + 当前对话的提示词,整个会话字符数非常庞大,且存在大量非当前阶段的必要信息,模型幻觉严重。通过安排分支节点,让 LLM 依据既定好的时间格子,分离出特定的时间片段,大幅度削减上游提示词注入的数量。
场景跳跃问题:
1. 设置主场景和其他场景
2. 总导演部分做场景限制,不允许短时间内跳跃多个主场景
3. 分镜部分提取时间格子后,自动判断和上一个时间格子内的场景差异,如果主场景改变,那么需要设计一下场景的改变
4. 锚定图部分如果识别到是多个场景,就主动提取多个美术场景并生成多个场景的图
口播语速过快问题:
1. 口播文字数量限制在 67 以内
2. 当人物说话过慢时,添加提示词要求说话稍快
部分镜头需要添加到 Badcase 中:
人车比例问题:
添加特定提示词,要求车比人高或者人比车高。
图像模型对人车比例敏感度和准确度不如 SD2,减少在图像模型对人车比的锚定。
在保持当前画布情况下:
1. 在架构上,针对开场和结尾单独设计子 Agent,单独生成,这样更具备开场的吸引力
2. 在画面稳定性和运镜动态上做一个权衡,现在的画面运镜太干瘪
3. 人物情绪太严肃,如果偏向更活泼的,考虑修改“总导演”的人格设定
TEMPLATE STACK // 01
右侧展示电商展示类工作流模板演示,包括有模特/无模特出镜版、3C数码展示及数字人口播。通过点击右侧卡片可将其动态切换为首要展示视频,左侧将同步更新对应的介绍与技术规格。
上传服装图,一键生成有模特出镜的服装展示视频。主要适用于电商服装首页展示视频。
上传服装图,一键生成无模特出镜的服装展示视频。主要适用于电商服装首页展示视频。
投入您的电商3C数码图,一键生成电商主页3C产品简介视频。
投入产品图,一键生成数字人带货讲解视频。
TEMPLATE STACK // 02
右侧展示新媒体矩阵类工作流模板演示,包括达人探店推广、商家自播口播、穿搭爆款种草以及美妆短视频带货。通过点击卡片可将其动态切换为首要展示视频,左侧将同步更新规格介绍。
上传达人图和店铺图一键生成达人探店种草视频+封面图+标题话题文案。承包一整套投流视频需求。
上传商家个人图片和店铺图,一键生成店铺推广口播种草视频+封面图+标题话题文案。承包一整套投流视频需求。
投入穿搭的服装图,一键生成网红服装种草视频。
投入美妆产品图,一键生成小红书风格网红美妆种草视频。
投入美妆产品图,一键生成抖音风格网红美妆种草视频。
TEMPLATE STACK // 03
右侧展示企业级应用模块工作流演示,包括数字人工作流构建及去AI感工作流。通过点击卡片可将其动态切换为首要展示视频,左侧将同步更新对应的规格与设计阶段介绍。
基于Infinite Talk模型的comfyui工作流。以1440p分辨率,24帧为基准,商业交付数字人时轻松突破一分钟时长限制。为公司本地化产品推出GGUF量化版本,可在16g显存使用。
主要基于zimge+wan 2.2 t2v模型 and 特殊区域局部提取节点以及ttp分块放大节点构建。运行速度快,经过3轮优化,在24g显存的4090显卡运行,时长消耗约40s,达到企业应用功能模块需求。
基于ltx2.3和rtx模型,实现视频准4K的放大修复。参数微调后,明显减少视频超分中的闪烁问题。在保持画面高清的情况下,视频生成速度是wan2.2系列的2-3倍。
基于wan 2.2 t2v模型和ttp分块放大节点构建。可以将视频超分至8K,且在细节填充修复上效果明显,对banana和image2模型多轮修改出现的噪点图有明显修复。在商业影片图像制作阶段,常用于最后一遍处理,可有效提升图像质感。
从用户实际场景出发,开发独立的 AI 原生系统与全栈应用,涵盖多 Agent 协同路由、自适应排版引擎以及全自动图文自媒体发布模块。
用户通过投入简单的提示词、选择渲染引擎和图文数量,秒级全自动生成一套配备完整文本笔记与排版图像的小红书爆款图文。
主编排器接收任务后,进行动态智能路由。垂直专家 Agent 混合检索向量数据库与知识图谱 (RAG),自动提取视觉排版模板与文案,再将其拆解为生图提示词,最后异步并发调用生图引擎完成多图实时渲染。
一款面向影视工业的全自动视频剪辑与视觉包装引擎。只需输入原始视频或剧本,系统即可一键交付包装完毕的成品视频。
以 RouterAgent 为决策大脑,将剪辑任务智能路由至各场景的垂类Agent。
采用“双引擎协同”,由 MLT 承接底层 VAD 跳剪与音频混音,Remotion 负责高阶 React 视觉组件渲染。
内置 Hybrid-Graph RAG 素材库,结合 “稠密向量”、“稀疏文本” 与 “知识图谱” 三种检索方式,并依托 RRF(倒数排名融合) 算法匹配最契合的 BGM、SFX 与包装模板。
基于 Next.js + React Flow 构建,适配 Harness Engineering。为节点提供独立的 LLM、记忆与知识库旁系支撑,高负载支持 500+ 节点稳定运行。
智能剧本拆解:分析创意文本,自动划分场景镜头,输出符合大模型意图的 JSON 脚本描述。
角色特征保持:输入演员参考图,锁定面部几何特征,生成不同动作、姿态下完全一致的角色图层。
电影级画幅生成:接受角色与场景描述,渲染 2K 高清画面,支持自定义相机广角、焦距和打光参数。
智能口型对齐:自研口型匹配算法,提取音频流音素,对人物图像口型进行二次变形水合,完全自然对口。
全局状态集中营:基于 Zustand 重构的单向数据流。全局监听节点连接与插拔,秒级广播画布状态更新。
局部按需水合:视口聚焦算法。仅对当前视野内的 Canvas 节点渲染 DOM,极大降低了画布整体的 DOM 开销。
WebGL 画布渲染:利用 WebGL 辅助硬件加速连线和节点发光效果,降低 CPU 负担,实现丝滑拖动。
嵌套复合子画布:支持双击节点后展开独立的全新画布空间,用于编辑影视子任务(如角色单视角创作)。
层级镜头混合器:将来自不同子画布的视频流/音轨在主工作台进行 3D 合成与分轨对齐,生成总装演播厅效果。
时间轴同步锁:帧级对齐算法,用于处理音频流(口型)与多机位视频的并发同步播放,保证声画合一。
通用 API 管道:支持将前端编排的工作流导出为完全兼容 ComfyUI 的原生 JSON 格式,直连企业云服务器生产。
生产线生命周期钩子:在工作流部署就绪后向 n8n 触发 Webhook 回调,自动完成企业飞书通知、邮件反馈。
何其有幸,
您看完了我全部内容,
请允许我用“同志”称呼您,
那是我们期盼的未来。
同志你好,
我们应该有很大概率不会相见,
能走到这里已经是我莫大的幸运。
我们总是会有各种各样的相遇,
总是会有各样的遗憾。
可遗憾也是悲凉的美
感谢世界的五彩斑斓,
相遇的缘分总能带来惊喜,
多幸运、多欢喜、多有趣。
走到这里,不胜感激,
辛苦同志,走此一遭。
如果我浪费了您的时间
请允许我补偿您一个tips
夏天很热,
米虫会悄悄靠近你的大米,
记得放冰箱里冷藏。
蛋清很脆弱,
沸水会把它剥离,
所以煮荷包蛋的时候记得把鸡蛋先放入冷水。