分区技术
1. 基于聚类的分区
- 典型方法:K-means 聚类分区
- 基本思想:根据数据点的特征,将数据划分到不同的聚类中心
- 分区规则:距离某个聚类中心最近的数据归为同一分区
特点:
- 能反映数据的内在结构
- 适合数据分布明显的场景
- 计算成本较高(需要聚类训练)
2. 空间划分
- 典型方法:KD-Tree(K-Dimensional Tree)
- 基本思想:基于数据点在多维空间中的坐标进行递归划分
- 分区规则:按维度不断切分空间
特点:
- 适合多维数据
- 查询效率较高(如范围查询、最近邻)
- 数据分布依赖空间结构
3. 随机划分
- 基本思想:将数据随机分配到不同分区中
- 不依赖数据分布或特征
特点:
- 实现简单
- 负载均衡效果较好
- 不能保证数据局部性
- 不适合依赖空间关系的查询
总结对比
| 分区方式 | 核心思想 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|---|
| 聚类分区 | 按数据相似性分组 | 结构性强 | 计算复杂 | 数据分布明显 |
| 空间划分 | 按坐标空间切分 | 查询效率高 | 依赖空间结构 | 多维数据 |
| 随机分区 | 随机分配 | 简单、均衡 | 无数据局部性 | 通用负载均衡 |
优点:降低了检索范围,从而提升查询效率;在分布式环境下易于扩展。 缺点:数据分布不均时,分区可能导致检索性能下降;动态数据插入时,分区可能需要频繁调整。
文本表示方法
1. 词袋模型(Bag of Words, BoW)
核心思想
- 统计文本中每个词出现的次数
- 将文本表示为词频向量
优点
- 实现简单
- 适合短文本处理
缺点
- 忽略词序
- 忽略语义关系
2. TF-IDF
核心思想
- 通过 词频(TF) + 逆文档频率(IDF) 衡量词的重要性
- 常见词权重降低,重要词权重提高
优点
- 能过滤高频无意义词
- 强调关键词
缺点
- 不适合长文本
- 忽略上下文语义关系
3. Word Embeddings(词向量)
核心思想
- 使用预训练模型将单词映射为固定长度向量
- 通过向量表达语义关系
优点
- 保留语义信息
- 支持语义相似度计算(如 cosine similarity)
缺点
- 静态向量
- 无法处理上下文变化(同一词不同含义)
4. Contextual Embeddings(上下文敏感嵌入)
核心思想
- 基于深度学习模型(如 Transformer)
- 根据上下文动态生成词向量
优点
- 支持一词多义(polysemy)
- 强上下文感知能力
缺点
- 计算资源消耗高
- 模型复杂度较高
对比总结
| 方法 | 是否考虑上下文 | 是否语义表示 | 优点 | 缺点 |
|---|---|---|---|---|
| BoW | ❌ | ❌ | 简单 | 丢失语义 |
| TF-IDF | ❌ | ⚠️ 弱 | 强调关键词 | 无语义关系 |
| Word Embedding | ❌ | ✅ | 有语义信息 | 静态 |
| Contextual Embedding | ✅ | ✅ | 动态语义 | 计算成本高 |
一句话总结
- BoW:只数词
- TF-IDF:加权词频
- Word Embedding:静态语义向量
- Contextual Embedding:动态语义表示(最强)
多模态数据预处理
1. 文本数据预处理
文本数据通常包含大量冗余信息与噪声,例如停用词、标点符号和拼写错误。如果不进行处理,可能会影响模型生成的向量质量,从而降低检索效果。
常用方法
-
去除停用词
- 删除“的”、“是”等高频但无实际语义贡献的词
- 降低噪声,提高语义有效性
-
文本标准化
- 统一大小写
- 去除 HTML 标签、特殊符号和多余空白
- 保证输入格式一致性
-
分词与词性还原
- 将文本拆分为词语(Tokenization)
- 还原词干或词根(Lemmatization / Stemming)
- 有助于捕捉核心语义信息
2. 图像数据预处理
图像数据在不同分辨率、光照条件下差异较大,若直接输入模型,容易引入无关特征干扰。
常用方法
-
归一化
- 将像素值缩放到 [0, 1] 或标准正态分布
- 减少数值尺度差异对模型训练的影响
-
数据增强
- 旋转、裁剪、翻转、加噪声等
- 扩充数据集,提高模型泛化能力
-
调整大小
- 统一图像分辨率
- 保证模型输入维度一致
3. 音频数据预处理
音频数据通常包含环境噪声与冗余信息,直接使用会影响语义特征提取效果。
常用方法
-
降噪
- 去除背景噪声
- 保留语音或目标音频信号
-
采样与分帧
- 按固定采样率采样
- 将音频切分为短时间帧
- 用于时域/频域分析
-
特征提取
- 提取频谱特征(如 Mel 频谱、MFCC)
- 将音频转换为可用于模型的嵌入表示
总结
| 数据类型 | 预处理目标 | 关键方法 |
|---|---|---|
| 文本 | 降噪 + 语义增强 | 去停用词、标准化、分词 |
| 图像 | 统一尺度 + 提升泛化 | 归一化、数据增强、resize |
| 音频 | 降噪 + 特征转换 | 降噪、分帧、频谱特征提取 |
一句话总结
- 文本:去噪 + 规范化 + 语义化
- 图像:统一尺度 + 增强泛化
- 音频:降噪 + 分帧 + 特征提取