Skip to content
Tse的笔记
Go back

向量数据库复习一

Edit page

分区技术

1. 基于聚类的分区

特点:


2. 空间划分

特点:


3. 随机划分

特点:


总结对比

分区方式核心思想优点缺点适用场景
聚类分区按数据相似性分组结构性强计算复杂数据分布明显
空间划分按坐标空间切分查询效率高依赖空间结构多维数据
随机分区随机分配简单、均衡无数据局部性通用负载均衡

优点:降低了检索范围,从而提升查询效率;在分布式环境下易于扩展。 缺点:数据分布不均时,分区可能导致检索性能下降;动态数据插入时,分区可能需要频繁调整。

文本表示方法


1. 词袋模型(Bag of Words, BoW)

核心思想

优点

缺点


2. TF-IDF

核心思想

优点

缺点


3. Word Embeddings(词向量)

核心思想

优点

缺点


4. Contextual Embeddings(上下文敏感嵌入)

核心思想

优点

缺点


对比总结

方法是否考虑上下文是否语义表示优点缺点
BoW简单丢失语义
TF-IDF⚠️ 弱强调关键词无语义关系
Word Embedding有语义信息静态
Contextual Embedding动态语义计算成本高

一句话总结

多模态数据预处理


1. 文本数据预处理

文本数据通常包含大量冗余信息与噪声,例如停用词、标点符号和拼写错误。如果不进行处理,可能会影响模型生成的向量质量,从而降低检索效果。

常用方法


2. 图像数据预处理

图像数据在不同分辨率、光照条件下差异较大,若直接输入模型,容易引入无关特征干扰。

常用方法


3. 音频数据预处理

音频数据通常包含环境噪声与冗余信息,直接使用会影响语义特征提取效果。

常用方法


总结

数据类型预处理目标关键方法
文本降噪 + 语义增强去停用词、标准化、分词
图像统一尺度 + 提升泛化归一化、数据增强、resize
音频降噪 + 特征转换降噪、分帧、频谱特征提取

一句话总结


Edit page
Share this post:

Previous Post
向量数据库复习二
Next Post
大数据系统复习四(完结)