EMO EMO (Emote Portrait Alive) 是阿里巴巴集团智能计算研究院的研究团队开发的一个音频驱动型肖像视频生成框架。具体来说,EMO系统基于音频信号驱动来生成肖像视频。用户只需要提供一张参考图片和一段音频文件(例如说话、唱歌的声音),EMO就能够根据音频内容生成一个生动的视频,视频中的人物会展现出丰富的面部表情和多变的头部动... 02,0900 AI大模型AI工具合集# AI肖像视频生成工具# Emote Portrait Alive# 单张照片生成视频
腾讯混元DiT 腾讯混元DiT是一个基于Diffusion transformer的文本到图像生成模型,也是业内首个中文原生的DiT架构文生图开源模型。该模型具有中英文细粒度理解能力,能够与用户进行多轮对话,根据上下文生成并完善图像。 02,0750 AI大模型AI工具合集# AI广告创意工具# 中文原生Diffusion Transformer模型# 中文文生图模型
Mistral AI Mistral AI 是一家来自法国的人工智能服务商,专注于大型语言模型和生成式人工智能的构建、培训和应用。Mistral AI 的目标是与 OpenAI 和 谷歌 竞争,为企业开发生成式人工智能基础设施。 02,0650 AI大模型AI工具合集
PixelDance PixelDance是由字节跳动开发的一款高动态视频生成模型,它能够根据用户提供的图片和文本描述来生成具有复杂场景和动态效果的视频。这项技术特别在于它结合了图像指令(针对视频片段的首尾帧)和文本指令,使得生成的视频不仅视觉上丰富,而且动作细节丰富,能够展现出高度的动态性。 02,0500 AI大模型AI工具合集# PixelDance# PixelDance视频生成模型# 图像指令视频生成
HoloDreamer HoloDreamer是一款文本驱动的3D场景生成框架,通过用户的文本描述生成沉浸式且视角一致的完整3D场景。它由风格化全景生成和增强型全景重建两个核心模块组成,该框架首先生成高清晰度的全景图作为完整3D场景的整体初始化,然后利用3D高斯散射(3D-GS)技术快速重建3D场景,从而实现视角一致和完全封闭的3D场景生成。HoloDreame... 02,0500 AI大模型AI工具合集# 3D场景生成# 3D场景生成工具# AI生成3D
盘古大模型 盘古大模型 3.0 是一个面向行业的AI大模型系列,包含自然语言、视觉、多模态、预测、科学计算大模型等五个基础大模型,可以为用户提供知识问答、文案生成、代码生成,以及多模态大模型的图像生成、图像理解等能力。 02,0200 AI大模型AI工具合集# AI模型训练# AI预测模型# 千亿参数AI模型
MuseV MuseV是一个由腾讯音乐娱乐旗下的天琴实验室推出的基于SD扩散模型的高保真虚拟人视频生成框架。支持文生视频、图生视频、视频生视频等多种生成方式,能够保持角色一致性,且不受视频长度限制。这意味着用户可以通过MuseV轻松地将文本、图像或现有视频转换成高质量的虚拟人视频,无需担心角色形象的不统一或视频时长的限制。 02,0150 AI大模型AI工具合集# ai数字人视频# AI数字人视频生成# MuseV
扣子空间 字节跳动推出的自动化AI平台,主打"一句话完成任务"功能。用户无需填写专业提示词、选择模板、模型或配置工具插件,提交任务后系统自动执行并返回结果。在扣子空间中,你可以与各类AI Agent协同工作。 02,0150 AI大模型AI工具合集# AI智能体协同平台# 智能协同办公平台
Adobe Firefly Image2 Adobe Firefly Image 2 是Adobe推出的一款生成式人工智能模型,建立在Firefly图像模型的基础上,专为设计师和创作者提供更强大、更智能的图像生成能力。它通过简单的文字描述,可以生成高质量的图像、文字效果和鲜艳的调色板。 02,0050 AI大模型AI工具合集# Adobe Firefly Image 2# AI 图像生成# ai绘画一键生成绘画
魔搭ModelScope社区 ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单! 01,9750 AI大模型AI工具合集# AI模型社区# 机器学习模型# 魔搭AI社区
神力霓裳 神力霓裳是阿里大文娱发布的自研影视妆造大模型。这个模型可以根据要求快速生成影视级的各朝代服饰造型,辅助造型师进行创意设计。它主要服务于古装剧,包含造型设计、妆发设计和纹样设计三大功能。 01,9750 AI大模型AI工具合集# 古装剧服饰设计# 影视妆造大模型# 影视造型设计工具
ClotheDreamer ClotheDreamer 是一种基于 3D 高斯方法的工具,用于从文本提示生成可穿戴的、可生产的 3D 服装资产。由上海大学、上海交通大学、复旦大学和腾讯优图实验室共同推出。它采用了一种名为 Disentangled Clothe Gaussian Splatting (DCGS) 的新型表示方法,使得服装和人体模型可以分别优化。 01,9600 AI大模型AI工具合集# 3D 服装生成# 3D服装模型# ClotheDreamer
Face Adapter Face Adapter 是一种专门为预训练的扩散模型设计的适配器,主要用于面部重演和面部交换任务。它能够实现高精度和高保真度的面部编辑,提供精细的个体识别和属性控制功能。 01,9500 AI大模型AI工具合集# AI换脸模型# Face Adapter# 面部交换
CogVideo CogVideo是目前最大的通用领域文本到视频生成预训练模型,含94亿参数。CogVideo将预训练文本到图像生成模型(CogView2)有效地利用到文本到视频生成模型,并使用了多帧率分层训练策略。 01,9450 AI大模型AI工具合集# CogVideo# 文本到视频生成预训练模型# 文本生成视频大模型
CrewAI CrewAI是一个创新的框架,专为角色扮演中的AI代理提供自动化设置。它通过促进AI代理之间的合作,使得这些代理能够共同解决复杂问题。CrewAI的核心特征包括角色定制代理、自动任务委派、任务管理灵活性和流程导向。它既可以使用OpenAI的API,也可以通过Ollama使用本地的大模型来运行程序。 01,9450 AI大模型AI工具合集# AI自动化代理# CrewAI# 多角色agent框架
DDColor DDColor是阿里达摩院研究的一种基于深度学习的图像上色模型,它可以自动将黑白或灰度图像着色,使图像更加生动逼真。 01,9300 AI大模型AI工具合集# ai怎么给图像上色# 图像着色工具# 灰度图像上色
V-Express V-Express是由南京大学和腾讯AI实验室共同开发的一项技术,旨在通过参考图像、音频和一系列V-Kps图像来生成说话的头像视频。这项技术可以根据不同的信号,如声音、姿势、图像参考等来控制视频内容,确保即使是弱信号也能有效地影响最终生成的视频,使视频生成更加逼真和多样化。 01,9300 AI大模型AI工具合集# AI视频合成# V-Express视频生成# 动态视频生成工具
星火大模型 讯飞星火大模型是由科大讯飞推出的新一代认知智能大模型,可基于自然文本、语音的方式提供多场景文本生成、语言理解、知识问答、逻辑推理、数学解答、代码生成和多模态7大能力。 01,9250 AI大模型AI工具合集# 国内大模型公司# 星火大模型# 科大讯飞大语言模型
MuseTalk MuseTalk是由腾讯推出的一个实时的高质量音频驱动唇形同步模型,能够根据输入的音频信号自动调整数字人物的面部图像,使其唇形与音频内容高度同步,支持多种语言,并实现每秒30帧以上的实时处理速度。这意味着观众可以看到数字人物的口型与声音完美匹配的效果。 01,9200 AI大模型AI工具合集# Lyra实验室MuseTalk# MuseTalk实时同步# 开源唇形同步模型
BuboGPT BuboGPT是字节跳动推出的一种先进的大型语言模型(LLM),它具有将文本、图像和音频等多模态输入进行整合的能力,并且具备将回复与视觉对象进行对接的独特功能,可以执行跨模态交互并做到对多模态的细粒度理解。这显示出BuboGPT在对齐或未对齐的任意图像音频数据理解方面有着出色的对话能力。 01,9100 AI大模型AI工具合集# BuboGPT# BuboGPT大型语言模型# 多模态理解与对话
千影QianYing 千影 QianYing 是一款由巨人网络 AI Lab 推出的有声游戏生成大模型,包含游戏视频生成大模型 YingGame 和视频配音大模型 YingSound。通过先进的人工智能技术,千影 QianYing 能够自动生成高质量、有声的游戏视频。YingGame 通过自定义角色、动作控制和物理模拟,创造互动性强的游戏内容;YingSoun... 01,8950 AI大模型AI工具合集# AI游戏创作工具# YingGame大模型# 千影QianYing
Hibiki Hibiki是一个Kyutai Labs开发的一个用于流式语音翻译(也称为同步翻译)的模型。与离线翻译不同,离线翻译需要等待源语句结束后才开始翻译,而 Hibiki 能够实时积累足够的上下文,以逐块生成正确的翻译。用户在讲话时,Hibiki 会在目标语言中生成自然的语音,并提供文本翻译。 01,8850 AI大模型AI工具合集# Hibiki# 实时语音翻译模型# 语音翻译模型
天壤小白大模型 天壤小白是基于语言大模型的AI应用开放平台,无需代码开发,即可快速、灵活地搭建个性化的AI应用。通过提示词工程、语义搜索、向量数据库等各类AI工具组件,破解幻觉难题,为开发者和企业提供一站式的大模型应用服务。覆盖知识管理、市场销售、客户服务、内容生成、辅助决策、多语言翻译等多个场景。 01,8800 AI大模型AI工具合集# Embedding# SQL生成# 商业分析
JoyGen JoyGen是一个音频驱动的3D深度感知说话人脸视频生成框架。它通过音频驱动生成嘴唇运动和视觉外观合成,旨在实现精确的嘴唇-音频同步和高视觉质量。 01,8800 AI大模型AI工具合集# 3D说话人脸生成# JoyGen# 音频驱动3D说话人脸视频模型
DeepSeek DeepSeek(深度求索) 是一款当前非常火爆的开源大型语言模型,因其性能媲美世界顶尖的闭源模型如 ChatGPT 和 Claude 而备受瞩目。该模型在极低成本的情况下完成训练,为用户提供了高效、精准的语言理解和生成能力。 01,8650 AI大模型AI工具合集# DeepSeek# 开源语言模型
ReSyncer ReSyncer 是由清华大学、百度和南洋理工大学 S-Lab 实验室联合开发的多功能 AI 框架,专注于视频合成技术。它能够生成与音频高度同步的逼真口型视频,支持个性化调整、视频驱动口型同步、说话风格迁移和人脸交换。ReSyncer 在创建虚拟主持人、电影配音和多语言内容制作等领域具有广泛应用前景。 01,8550 AI大模型AI工具合集# ReSyncer# 人脸交换技术# 视频口型同步
RAGFlow RAGFlow是一款开源的检索增强生成(RAG)引擎,专为深入理解文档而设计。它为各类企业和个人提供简洁高效的RAG工作流程,与大语言模型(LLM)相结合,针对各种复杂格式的数据提供可靠的问答及有依据的引用。RAGFlow非常适合需要动态内容生成且依赖外部知识库的场景,如智能客服、文档生成和数据分析等,助力用户高效挖掘大量数据中的有价值信... 01,8500 AI大模型AI工具合集# 开源RAG引擎# 文档解析工具
FireRedASR FireRedASR是一款由FireRedTeam开发的开源工业级自动语音识别(ASR)模型,支持普通话、中文方言和英语。它在公开的普通话 ASR 基准测试中取得了新的最优结果,并且在歌词识别方面表现出色。 01,8350 AI大模型AI工具合集# FireRedASR下载# 开源语音识别工具# 自动语音识别模型
MiracleVision奇想智能 MiracleVision奇想智能是由美图秀秀公司推出的自研AI视觉大模型。它具备高度的美学导向和图像处理能力,并能广泛应用于多个行业,以提高工作流效率。该模型不仅提供了简单易用的AI视觉创作工具,使用户能够快速进行图像的创作和编辑,还支持多种图像类型和视频效果的生成。 01,8300 AI大模型AI工具合集# AI视觉大模型# AI视觉技术# MiracleVision奇想智能
SDXL-Lightning SDXL-Lightning是一款由字节跳动开发的开源免费的文生图开放模型,能根据文本快速生成相应的高分辨率图像。该模型能够在极短的时间内生成高质量和高分辨率的图像,是目前最快的文生图模型之一。 01,8250 AI大模型AI工具合集# SDXL-Lightning# SDXL-Lightning模型# 图像生成模型优化