
人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载导读gbrain 的 Chat Connectors 提供了一条实时会话归档通道用你自己的浏览器会话凭据Cookie把 ChatGPT 与 Claude 的对话历史增量、可定时地同步进 brain作为已有conversation-archive导出文件通道的活前端。读完本文你将掌握 Cookie 采集、dry-run → 采样 → 全量回填的完整同步流程、watermark 增量机制与 gap-heal 原理、autopilot / host cron 两种自动化接线方式以及 Credential 安全姿态和 Cloudflare 反爬限制下的降级方案。一句话定位导出文件通道的实时前端Chat Connectors 同步的是你自己的 AI 助手会话历史使用你自己的会话凭据增量执行、可按需定时opt-in。它正是conversation-archiveskill 已文档化的导出文件通道的 LIVE 前端——connector 只把手动下载 export 文件这一步替换为自动抓取下游的一切脱敏 redaction、slug 生成、长会话分片、幂等去重完全复用gbrain transcripts ingest这条管线绝无第二套实现。相关约定见 conversation-archive skill。v1 提供两个在线 ProviderChatGPT与Claude均为 live。Perplexity 目前没有 live connector没有 transcript adapter请继续走 conversation-archive 的手动转换路径。快速开始最自然的入口是直接对你的 Agent 说一句Connect my chatgpt account and pull my whole history into the brain、Connect my claude account、Keep my conversations synced automatically.——chat-connectors skill 会引导走完整流程Cookie 采集 → dry-run → 采样 → 全量回填 → opt-in 定时。下面命令是等价的手动路径# 1. 连接Cookie 粘贴是主通道经 stdin 输入避免进入 argv gbrain connectors auth chatgpt --cookie - # 粘贴完整 Cookie 请求头Ctrl-D gbrain connectors auth claude --cookie - # 粘贴 sessionKeyvalueCtrl-D # 2. 首次同步预览 → 采样 → 全量 gbrain connectors sync chatgpt --dry-run gbrain connectors sync chatgpt --limit 5 gbrain connectors sync chatgpt --full # 3.可选开启自动同步 —— opt-in每日一次 gbrain config set connectors.chatgpt.auto_sync true gbrain autopilot --installgbrain connectors status展示凭据来源provenance/过期时间与同步状态永不显示密钥本身gbrain connectors logout provider删除对应凭据。skill 还给出了一个前置纪律任何一次同步前先检查 brain 里已有什么gbrain search/query/get遵循 brain-first 约定——同步本身是增量和幂等的正是为了不做已经settled的工作。工作原理一次同步的完整调用链从 sync.ts 编排器 的源码看一次 connector 同步的完整管线是cookie/token (~/.gbrain/connectors/p.json, 0600) │ ▼ ConnectorClient ── list (metadata, newest-first, stop at watermark−7d) │ └─ archived second pass (ChatGPT) ▼ fetch each new conversation ──▶ spool (native-export shape, 0600, batched) │ │ │ ▼ │ runTranscriptsIngest (redact → slug → split → import) ▼ │ watermark (config scalar) ◀──────────┘ advance ONLY on a fully clean run connectors.p.watermark_iso receipt → ingest_log; stamp last_sync_at关键实现事实均可在源码中验证列表→抓取两级分离metadata 列表廉价且分页ChatGPT 侧LIST_PAGE_LIMIT 28MAX_LIST_PAGES 500见 chatgpt.ts真正昂贵的是逐会话的 detail fetch。spool 批处理抓到的会话按CONNECTOR_SPOOL_BATCH分批写入 spoolnative-export 形状、0600再调用runTranscriptsIngest每批 ingest 完成后立即删除 spool 文件未脱敏的 spool 绝不残留。漂移守卫ChatGPT 列表若解析成功但没有items数组立即抛错中止该 pass绝不把截断列表当作没有更多detail 若无mapping树同样报漂移见 chatgpt.ts。ChatGPT 双 pass 列表先列活跃线程再列is_archivedtrue的归档线程run 的 watermark 取两次 pass 中最大的updatedAt。增量同步 gap-heal间隙自愈每个 Provider 在config 表中维护一个 watermarkconnectors.provider.watermark_iso——记录已导入的最新会话更新时间。后续运行从新到旧列出会话并在到达watermark − windowDays默认 7 天处停止因此只抓取真正的新会话detail fetch 贵、metadata 列表便宜且分页刚好落在 watermark 之后、但在 trailing window 内被编辑过的会话会被重新列出并原位重导不会出现静默空洞。watermark只在完全干净的运行后推进无抓取错误、无--limit截断、ingest 干净。partial运行会保持 watermark 不动让下一次运行自愈。由于内容哈希幂等重导永远安全参见 sync.ts 中clean判定与推进条件。为什么 watermark 必须是 config 标量而不是op_checkpoint源码注释给出了明确理由sync.tsop_checkpoint存的是已完成 key 集合没有标量时间戳且 7 天后会 GC 行——一旦你的同步间隔超过一周watermark 被清掉就会触发全量重新抓取这正是最容易触发 Provider 反滥用风控的流量模式。config 表持久且永不 GC。终端状态与结果码同步器不会对预期终端状态抛异常而是返回状态码供 CLI 与 minion handler 呈现sync.tssuccess/nothing_new/partial/auth_required/forbidden/dry_run/not_supported。每次运行的收据形如chatgpt: success listedN fetchedN errors0 importedN skippedN redactionsN watermark→iso该收据由编排器写入ingest_log并顺带 stamplast_sync_atsuccess与nothing_new都算运行过。同步命令全参数connectors/sync.ts 中gbrain connectors sync支持的标志标志含义chatgpt\|claude或--all指定 Provider或对所有已有凭据的 Provider 同步无凭据则报错退出--full忽略 watermark 全量回填首次/修复用--dry-run只列不抓不抓 detail、不写任何页面、不动 watermark返回dry_run并提示将抓取 N 条会话--limit N本次最多抓取 N 条有截断 ⇒ 不算干净运行watermark 不推进--window-days N覆盖 gap-heal 尾窗天数默认 7来自DEFAULT_WINDOW_DAYS--source id页面落库的 source默认取connectors.source_id再默认default--embedingest 期间同步 embedding默认关闭——由 run 结束后的 embed kickoff 兜底--backgroundPostgres 下提交connector-syncminion 作业单飞 per providerPGLite 无 worker daemon自动退化为 inline 并提示--json以 JSON 输出结构化结果引擎分支PGLite默认引擎无 worker daemon同步内联执行Postgres 下--background会以connector-sync:${provider}:${hour}作为幂等键、max_attempts: 2入队sync.ts用gbrain jobs get id跟踪。Embed 后置回填每次干净 run 后若本次导入页数 ≥connectors.embed_kickoff_min_pages默认 25编排器会触发 embedding 回填sync.tsPostgres 走submitEmbedBackfill提交作业可能返回 cooldown / spend_capped / no_worker_surface 等分支PGLite 则内联执行runEmbedCore({ stale: true })。低于阈值则是 no-op。自动化通道均为 opt-in定时同步按 Provider 独立 opt-in默认每日一次。它在按节奏轮询你的账号——那是你的账号在发出自动化请求因此默认关闭直到你显式开启Autopilot推荐harness 无关gbrain autopilot --install会自动选择合适的 OS 定时机制launchd / systemd / crontab / 容器启动脚本并运行 dispatch。它是凭据门控 auto_sync门控的Cookie 失效会立刻停表并在gbrain doctor中暴露出来。Host cron无守护进程0 6 * * * gbrain connectors sync --all每日。用gbrain config set connectors.sync_floor_min minutes调整节流下限默认 1440。调度节流在 config-keys.ts 中有纯函数实现isConnectorSyncStale没有历史同步记录或上次同步早于floorMin分钟才算到期该同步。配置键全表KeyDefault含义connectors.source_iddefault页面落库的 sourceconnectors.sync_floor_min1440定时同步节奏下限分钟connectors.embed_kickoff_min_pages25单次 run 导入 ≥ 此页数时触发 embed 回填connectors.doctor_stale_hours72gbrain doctor对停滞的自动同步报警的阈值小时connectors.p.auto_syncoff某 Provider 的 opt-in 定时同步connectors.p.last_sync_at—每次 run 打时间戳staleness 门控依据connectors.p.auth_error_at—凭据失效时打时间戳connectors.p.watermark_iso—增量 watermark所有键都注册在connectors.前缀下config-keys.ts与调度判定、doctor 报警、embed 阈值一一对应auto_sync类布尔值用isTruthy解析1/true/yes/on。凭据的环境变量覆盖事故逃生舱GBRAIN_CONNECTOR_PROVIDER_COOKIE/_TOKEN。解析优先级为env filegbrain connectors status会如实标注凭据来自 env 还是文件绝不撒谎credentials.ts。安全与姿态凭据即口令session cookie / token 与密码等价。它们只存在于文件平面~/.gbrain/connectors/provider.json0600目录 0700永不进入 DB、sources.config、config 平面或任何 op 载荷唯一网络出口是 Provider 自己的主机。写入是原子操作tmp rename chmod backstop见 credentials.ts。Cookie 采集走 stdin--cookie -从 stdin 读取凭据不进 argv、不进ps可见的命令行auth.ts。每次 auth 都带 probe任何认证路径都以一次探活 一行 verdict 收尾probe 失败默认不保存任何东西除非显式--force。ChatGPT 还支持--try-oauthbest-effort OAuth PKCE loopback--no-browser可禁用自动开浏览器ChatGPT token 通常 codex 作用域失败会回落到 cookie 通道——见 auth.ts 与 chatgpt.ts 的 OAuth 配置。转录脱敏任何页面写入前都会按 secret 模式脱敏与导出文件通道完全一致spool 0600 且 ingest 后即修剪。仅本地操作connectors_status/connector_sync是localOnlyop绝不通过 MCP 暴露凭据。你的数据、你的账号你同步的是自己账号下、与官方 export 相同的数据。请保持礼貌节奏默认每日避免自动化轮询威胁你的账号。凭据过期时Cookie 通常几天到几周有效同步会 stampauth_error_at调度器停止空转烧槽gbrain doctor提示 re-auth needed重新执行gbrain connectors auth即可。可行性注意Cloudflare 反爬chatgpt.com/claude.ai背后有 bot-management会对 TLS/HTTP2 握手做指纹识别且cf_clearance绑定真实浏览器。服务端fetch即使带着有效 Cookie仍可能吃到 403 challenge。此时 connector 如实上报forbidden并引导你走官方导出通道绝不循环重试。如果你的环境里服务端 fetch 被稳定拦截优先走导出文件通道conversation-archive——它永远可用。故障排查症状原因修复forbiddenCloudflare/bot challenge 拦了服务端 fetch官方导出 gbrain transcripts ingestauth_requiredCookie 过期/无效重新复制新鲜 Cookie 头gbrain connectors authpartial部分抓取失败watermark 未推进直接重跑即可自愈收据显示 driftProvider API 形状变更受影响线程被跳过不丢失导出通道仍可用补充一点 skill 的 anti-pattern 清单以提醒边界不要往 config、sources.config、聊天日志或 commit 里贴 Cookie只走文件平面 0600 与 stdin不要为了刷量把同步节奏压到sync_floor_min以下轮询风险在用户自己的账号上不要把partial当完成不要对forbidden循环重试不要在这里自建 importer一律 spool 成 native-export 形状后复用现有管线也不要用 session hooks 做定时hooks 只有亚秒级、纯文件预算请用 autopilot 或 host cron。v2 路线图官方文档列出的演进方向Perplexity live client 原生perplexitytranscript adapter、面向 connector 健康度的 advisor collector、每 Provider 多账号、附件/图片捕获、export-ZIP 自动解包、以及 nightly 的 spec-target 漂移探测。当前仓库中对应的CHATGPT_BACKEND_API_SPEC_TARGET标记为 provisionalchatgpt.tsdrift 报警是运行时兜底——这正是文档反复强调导出文件通道永远兜底的原因。赞分享人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载相关推荐Agno 智能体会话状态与会话管理实战指南状态、聊天历史与持久化Agno 智能体会话状态与会话管理实战指南状态、聊天历史与持久化 导读 本文基于 Agno 仓库 cookbook/02_agents/05_state_an人工智能大模型AI AgentAgent 框架多智能体工具调用RAGAgent 工作流Agent 记忆LlamaIndex DynamoDB Chat Store用 AWS DynamoDB 持久化多会话聊天历史的完整指南LlamaIndex DynamoDB Chat Store用 AWS DynamoDB 持久化多会话聊天历史的完整指南 本文围绕 LlamaIndex 官方人工智能RAG大模型claude-mem Knowledge Agent 实战把历史观察编译成可对话的专属记忆大脑claude mem Knowledge Agent 实战把历史观察编译成可对话的专属记忆大脑 claude mem 的 Knowledge Agent人工智能Agent 记忆RAGMCP 服务知识图谱AI 插件创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考