快乐冲浪与生活

多体验、多体会、多体悟

0%

  • TabICL:主打大规模表格分类 + 回归,解决传统表格 ICL 样本上限瓶颈,两阶段嵌入,大数据集速度优势最强。
  • LimiX通用结构化基础模型(LDM),一模型做多任务(分类、回归、缺失填充、生成、因果推理),轻量版本 CPU 可用,核心是行列双注意力联合分布建模。
  • Nori回归专精,原生输出预测分布/不确定性,但分类能力弱,上下文样本上限低。

设计思路

TabICL

距离度量的重要性

pgvector 提供 6 种距离度量方式,选择合适的距离度量方式对于数据库的检索效果有着重大影响。

选错距离度量方式,不会报错,但会让"最相似"的结果排错位置 —— 而且很难察觉。举 3 个例子说明选择合适距离度量方式的重要性。

在大模型时代,应用须提供语义搜索或知识检索功能,如果后端数据库本身使用的就是 PG,则可以直接使用 pgvector 来实现,无需额外的数据库组件。

什么是 pgvector

pgvector 是 PostgreSQL 的一个开源扩展,它让 PG 能够原生存储、索引和检索高维向量(embedding)。 它把"向量相似度搜索"这一原本需要专门向量数据库的能力,直接下沉到了你熟悉的关系型数据库里。常用于语义搜索、RAG 检索、推荐系统等 AI 场景,让应用用一条 SQL 就能做"找最相似的 N 条数据"。

文本相似度

文本相似度,简单说就是量化两段文本的内容重合语义相近程度,是 NLP 最基础、最高频的任务之一。

日常业务中随处可见:

  • 文章查重、内容去重
  • 问答系统:用户提问与历史问题匹配
  • 搜索推荐:相似内容召回
  • 评论舆情:重复言论过滤
  • 短文本匹配、指令对齐

文本相似度算法主要分两类: