本文档适用于 Multimodal SDK 最新发布版本。接口异常通常以 [object Object]、[object Object]、[object Object] 或 [object Object] 抛出,错误码处理建议请参见。
Tensor 类将被用于承载任意模态的通用数据,实现通用数据的创建、管理以及数据复制等操作。
功能描述
设置数据排布格式。
函数原型
输入参数说明
示例
功能描述
深拷贝 Tensor 实例对象为新的 Tensor 实例。
函数原型
返回值说明
示例
功能描述
将 Numpy 数组转化为 Tensor 对象。
函数原型
输入参数说明
返回值说明
[object Object]
示例
功能描述
将 Tensor 对象转化为 Numpy 数组。
函数原型
返回值说明
[object Object]
示例
功能描述
将 torch.Tensor 张量转化为 Tensor 对象。
函数原型
输入参数说明
返回值说明
[object Object]
示例
功能描述
将 Tensor 对象转化为 torch.Tensor 张量。
函数原型
返回值说明
[object Object]
示例
功能描述
Tensor 类成员函数,使用均值和标准差对当前对象进行归一化。给定 n 个通道的均值:(mean[1],...,mean[n])和标准差:(std[1],...,std[n]),此变换将对当前对象的每个通道进行归一化,即 output[channel] = (src[channel] - mean[channel]) / std[channel],其中 src 为当前 Tensor 对象。
函数原型
输入参数说明
返回值说明
[object Object]
示例
Image 类将被用于承载图像数据,实现通用图像的创建、管理以及数据复制等操作。
功能描述
通过指定路径创建 Image。
函数原型
输入参数说明
返回值说明
示例
功能描述
将 Numpy 数组转化为 Image 实例。
函数原型
输入参数说明
返回值说明
[object Object]
示例
功能描述
将 Image 实例对象转换为 Numpy 数组。
函数原型
返回值说明
[object Object]
示例
功能描述
将 torch.Tensor 转化为 Image 实例。
函数原型
参数说明
[object Object]
返回值说明
示例
功能描述
将 Image 实例对象转换为 torch Tensor 张量。
函数原型
返回值说明
[object Object]
示例
功能描述
将 PIL 图像对象转换为 Image 对象。
函数原型
输入参数说明
返回值说明
示例
功能描述
将 Image 对象转换为 PIL 图像对象。
函数原型
返回值说明
[object Object]
示例
功能描述
深拷贝 Image 实例对象为新的 Image 实例。
函数原型
返回值说明
示例
功能描述
对 Image 实例对象进行缩放操作。
函数原型
参数说明
返回值说明
[object Object]
示例
功能描述
对 Image 实例对象进行裁剪操作。
函数原型
参数说明
返回值说明
[object Object]
示例
功能描述
对 Image 实例对象进行[0,255]至[0.0, 1.0]缩放,以及格式转换能力(HWC->CHW)。
[object Object]
函数原型
参数说明
返回值说明
示例
用户注册日志级别与日志回调函数。
日志注册函数。
函数原型
输入参数说明
[object Object]
示例
功能描述
将传入的视频文件解码,并返回 Image 对象列表。
函数原型
输入参数说明
返回值说明
[object Object]
示例
[object Object][object Object]
功能描述
使用均值和标准差对 Tensor 对象进行归一化。给定 n 个通道的均值:(mean[1],...,mean[n])和标准差:(std[1],...,std[n]),此变换将对输入 Tensor 对象的每个通道进行归一化,即 output[channel] = (src[channel] - mean[channel]) / std[channel]。
函数原型
输入参数说明
返回值说明
[object Object]
示例
[object Object][object Object]
功能描述
使用音频加载接口,对给定的音频实现加载。支持对单音频文件加载以及对批量音频的并行加载,支持开关重采样。
函数原型
输入参数说明
返回值说明
[object Object]
示例
[object Object][object Object]
基于文本-图像匹配的关键帧选择器抽象基类,封装模型初始化、特征提取、边界定位、输入校验和相似度计算等公共能力。该类不可直接实例化,需通过子类 KRangFrameSelector 或 KFrameSelector 使用。
功能描述
初始化关键帧选择器,加载指定模型并完成参数校验。
函数原型
输入参数说明
[object Object]
功能描述
从视频帧序列中选择与查询文本相关的关键帧,为抽象方法,由子类实现具体选择策略。
函数原型
输入参数说明
返回值说明
基于区间合并的关键帧选择器,继承自 BaseFrameSelector。定位与查询文本相关的连续场景区间,并在区间内自适应采样关键帧,适用于需要时序上下文的任务。
功能描述
区间关键帧选择主流程:提取特征并计算相似度后,贪心选择候选帧并扩展为场景区间,合并相邻语义相似区间,最后在区间内自适应重采样。
函数原型
输入参数说明
返回值说明
示例
离散关键帧选择器,继承自 BaseFrameSelector。选择与查询文本相关且视觉多样的离散关键帧,适用于需要视觉多样性的任务。
功能描述
离散关键帧选择主流程:提取特征并计算相似度后,贪心选择候选帧,并通过特征距离去重保证视觉多样性。
函数原型
输入参数说明
返回值说明
示例