快乐冲浪与生活

多体验、多体会、多体悟

0%

在大模型时代,应用须提供语义搜索或知识检索功能,如果后端数据库本身使用的就是 PG,则可以直接使用 pgvector 来实现,无需额外的数据库组件。

什么是 pgvector

pgvector 是 PostgreSQL 的一个开源扩展,它让 PG 能够原生存储、索引和检索高维向量(embedding)。 它把"向量相似度搜索"这一原本需要专门向量数据库的能力,直接下沉到了你熟悉的关系型数据库里。常用于语义搜索、RAG 检索、推荐系统等 AI 场景,让应用用一条 SQL 就能做"找最相似的 N 条数据"。

文本相似度

文本相似度,简单说就是量化两段文本的内容重合语义相近程度,是 NLP 最基础、最高频的任务之一。

日常业务中随处可见:

  • 文章查重、内容去重
  • 问答系统:用户提问与历史问题匹配
  • 搜索推荐:相似内容召回
  • 评论舆情:重复言论过滤
  • 短文本匹配、指令对齐

文本相似度算法主要分两类:

TimescaleDB 介绍

TimescaleDB 是一个基于 PostgreSQL 的时间序列数据库扩展(不是独立数据库),通过安装扩展把 Postgres 变成能高效处理时序数据的引擎,兼容所有 Postgres 生态。TimescaleDB 使用场景下的数据带有 3 个明显的特征:

系列文章第 1 篇 · AI Agent 六大主流架构拆解 本篇拆解最经典的 ReAct(Reasoning + Acting),并把它落到一个真实场景——油菜育种种质助手

什么是 ReAct

ReAct 由姚顺雨等人在 2022 年论文《ReAct: Synergizing Reasoning and Acting in Language Models》中提出的 AI Agent 框架,其核心思想是:让大语言模型把"推理(Reasoning)“和"行动(Acting)“交错成循环 —— 每一步先想清楚下一步该做什么(Thought),再去真正调用一个外部工具(Action),拿到工具返回的结果(Observation),再回想,如此往复,直到信息足够给出最终答案。