
Meeting Intelligence 技能评估指南用决策与状态会议两大场景验证 Codex 的会议材料生成质量【免费下载链接】skillsSkills Catalog for Codex项目地址: https://gitcode.com/GitHub_Trending/skills4/skills本文以仓库中 notion-meeting-intelligence 技能评测说明 为核心系统讲解该技能在 Codex 中的评估目标、两个内置评测场景的完整行为标准与成功判据、运行评测的实操步骤以及如何扩展新的评测用例。读完本文你将掌握如何用可测试、可判定的标准去验证一个 AI 会议准备技能是否真正做到了先取 Notion 事实、再用 Codex 增强、双文档分离产出。评估的定位为什么会议准备技能需要专门评测Meeting Intelligence 技能见 SKILL.md的目标是通过拉取 Notion 工作区上下文、按会议类型选择模板、产出内部 Pre-Read 与外部 Agenda 两份文档并用 Codex 研究做增量增强。这类能力高度依赖模型行为的一致性因此仓库专门在 evaluations/ 目录下提供了结构化评测场景。评测 README 明确列出评测要回答的五类问题这也是所有评测场景共用的评估框架是否从 Notion 工作区收集上下文而不是凭空编造或只依赖模型知识是否恰当使用 Codex 研究做增强增强要锦上添花而非填充废话是否同时产出内部 Pre-Read 与外部 Agenda 两份文档能否清晰区分Notion 事实与Codex 洞察敏感信息只进内部文档在 Haiku、Sonnet、Opus 等不同 Codex 模型下行为是否一致。两个内置评测场景评测目录下有两个 JSON 文件每个文件都是一个完整的提示词 期望行为步骤 成功判据三元组可直接用于人工或自动化验证。场景一决策型会议准备decision-meeting-prep.json文件位于 decision-meeting-prep.json评测场景是为数据库迁移决策会议做会前准备。其测试查询为Prep for tomorrows meeting where we need to decide on our database migration approach. Create both an internal pre-read for the team and an agenda for the meeting.该场景把完整行为拆解为 8 个可检查步骤用Notion:notion-search搜索数据库迁移相关上下文项目页、技术规格、历史讨论、方案分析用Notion:notion-fetch抓取至少 2~3 个相关页面从抓取的 Notion 内容中识别待决策事项与可选方案用 Codex 研究增强补充决策框架如成本收益分析、风险评估、迁移方案的技术背景、数据库迁移最佳实践在综合输出中明确区分 Notion 事实与 Codex 洞察用Notion:notion-create-pages创建内部 Pre-Read标题形如INTERNAL: Database Migration Decision - Pre-Read - [Date]创建外部 Agenda标题形如Meeting Agenda: Database Migration Decision - [Date]双向交叉链接两份文档且两份文档都用mention-page url...标注来源页面。对应的成功判据success_criteria共 12 条其中最关键的可判定标准包括必须创建两份文档而非一份内部 Pre-Read 必须标注INTERNAL或For team onlyPre-Read 结构须遵循 SKILL.md 定义的Meeting Overview → Background → Current Status → Context Insights → Key Discussion Points → What We Need外部 Agenda 结构须遵循Meeting Details → Objective → Agenda Items → Discussion Topics → Decisions Needed → Action Items → Related ResourcesCodex 增强必须真实带来决策框架、迁移最佳实践或风险模式等增量价值两份文档标题都必须包含会议日期。场景二状态更新会议准备status-meeting-prep.json文件位于 status-meeting-prep.json评测场景是为 Mobile App Redesign 项目的周五状态评审会做准备。它额外依赖task-manager技能测试查询为Prep for Fridays project status meeting on the Mobile App Redesign project. Create both an internal pre-read and an external agenda.该场景的期望行为比决策场景多一步数据查询共 9 步用Notion:notion-search找到 Mobile App Redesign 项目页用Notion:notion-fetch抓取项目页获取当前状态与上下文用Notion:notion-search找到任务数据库用Notion:notion-query-data-sources查询任务WHERE Project Mobile App Redesign分析任务数据计算完成百分比识别已完成、进行中与受阻任务用 Codex 研究增强补充项目管理洞察速度趋势、风险模式、常见项目陷阱若发现风险则建议讨论框架并提供时间线影响分析创建内部 Pre-Read标题形如INTERNAL: Mobile App Redesign Status - Pre-Read - [Date]须包含详细指标、受阻项与战略考量创建外部 Agenda标题形如Meeting Agenda: Mobile App Redesign Status Update - [Date]采用状态更新结构Meeting Details → Objective → Agenda Items(定时) → Discussion Topics → Action Items只放摘要级指标双向链接两份文档并分别用mention-page与mention-database链接项目页与任务数据库。这一场景特别考验两点指标准确性进度指标必须来自notion-query-data-sources的真实查询结果如X 完成、Y 进行中、Z 受阻而非模型臆测和信息分级详细的受阻分析与内部战略讨论只能进 Pre-Read外部 Agenda 不得包含。如何运行评估评测 README 给出了 6 步运行流程可与 SKILL.md 的 Quick start 与 Workflow 对照执行启用meeting-intelligence技能若 Notion MCP 未连接先按 SKILL.md 第 0 步配置codex mcp add notion --url https://mcp.notion.com/mcp、开启rmcp_client、codex mcp login notion提交评测文件中的查询语句直接使用两个 JSON 中的query字段验证技能先搜 Notion 再查 Codex即先Notion:notion-search/Notion:notion-fetch顺序不能颠倒检查是否创建了两份文档内部 Pre-Read 外部 Agenda验证 Codex 增强是否增值而不替代Notion 内容仍是主体Codex 只做补充在 Haiku、Sonnet、Opus 三种模型上分别测试确认行为一致性。在运行前建议先阅读 template-selection-guide.md 熟悉模板选型规则决策会议选 decision-meeting-template.md、状态评审选 status-update-template.md 等并用 examples/project-decision.md 这类端到端示例做预期参照——示例中展示了从notion-search检索、notion-fetch抓取、到notion-create-pages产出议程、再以notion-create-comment通知参会者的完整调用链。期望技能行为的四个维度评测不是只看产没产出材料而是按以下四个维度逐项核验这些标准同样适用于评测人员观察输出1. Notion 上下文收集先搜索工作区内的相关上下文而非直接请求 Codex 研究抓取具体页面如项目页、历史讨论、规格文档而不是泛泛而谈从 Notion 内容中提取关键信息用mention-page标签标注来源。2. Codex 研究增强补充行业背景、决策框架或最佳实践增强内容必须相关且有价值不允许凑数填充明确区分Notion 事实与Codex 洞察研究内容补充而非替代Notion 内容。3. 双文档产出内部 Pre-Read全面包含策略、建议、详细的利弊权衡外部 Agenda专业、聚焦会议流程不含内部策略两份文档都有清晰标注文档之间互相交叉链接。4. 文档质量Pre-Read 遵循结构Overview → Background → Current Status → Context Insights → Discussion PointsAgenda 遵循结构Details → Objective → Agenda Items(含时间) → Decisions → Actions → Resources标题包含日期或会议上下文内容可执行、可直接用于会议。编写新评测场景的指南评测 README 为扩展评测给出了 5 条指导原则新建的 JSON 评测文件应遵循覆盖不同会议类型——除了已有的决策decision与状态status还应测试头脑风暴brainstorm、一对一1:1、冲刺规划sprint planning、复盘retrospective等对应模板均已收录在 reference/ 目录变化复杂度——从简单的状态更新到复杂的战略决策都要覆盖测试有/无 Notion 内容两种情形——内容丰富的 workspace 与页面稀少的 workspace 都应验证验证增强价值——追问Codex 研究是否真的有用而非形式化地附加检查内外文档区分——敏感信息是否只保留在 Pre-Read 中。新建场景时参考现有 JSON 的结构name场景名、skills依赖的技能列表、query提交给模型的查询、expected_behavior逐步的期望行为、success_criteria可判定的成功标准。注意status-meeting-prep.json展示了多技能协作写法skills: [meeting-intelligence, task-manager]当场景需要查询任务数据库时应把任务管理技能一并纳入依赖。成功标准示例可测试与不可测试评测最关键的一环是把好的标准写具体。README 末尾给出了正反两组示例这也是编写success_criteria时的直接模板好的标准具体、可测试创建两份文档内部 Pre-Read 外部 Agenda内部 Pre-Read 标注 INTERNAL ONLY 或 For team only用 mention-page 标签引用至少 2~3 个 Notion 页面Agenda 为每个环节分配时间Codex 增强包含决策框架或最佳实践差的标准模糊、不可测试创建会议材料有效收集上下文准备得当对照两个 JSON 文件可以验证这一点decision-meeting-prep.json的每条成功判据都满足可验证要求例如内部 Pre-Read 全面包含 Notion 上下文 Codex 洞察 详细利弊 建议至少引用 2~3 个 Notion 来源页面两份文档互相交叉链接标题包含会议日期而status-meeting-prep.json则新增了进度指标必须与notion-query-data-sources结果一致这类以数据为准绳的判据。这正是评测体系可落地执行的关键。结合仓库源码的纵深理解SKILL.md 工作流与评测步骤的映射SKILL.md 定义了 5 步主工作流收集输入确认目标、参会人、时间与既有材料搜索并抓取 Notion 页面→ 选择格式按会议类型选模板→ 构建议程/Pre-Read分配负责人与时间盒→ 用研究增强引用来源、区分事实与观点→ 定稿分享补充下一步与负责人必要时创建/关联任务用notion-update-page跟进变更。评测 JSON 中的expected_behavior步骤序列正是对这套工作流的可观测化例如决策场景的 Step 1~3 对应工作流第 1~2 步Step 4~5 对应研究增强Step 6~8 对应双文档创建与链接。模板结构是评测文档质量的基线两个 JSON 的成功判据中反复出现的结构要求直接对应 reference/ 下的模板。以 decision-meeting-template.md 为例其章节为Meeting Details → Pre-Read SummaryBackground / Current Situation→ Decision Required → Options Analysis含 Do Nothing 选项→ Recommendation → Discussion Topics → Decision Framework → Decision → Action Items → Follow-up恰好是评测判据中详细利弊 建议 决策框架的落地载体status-update-template.md 则提供 Executive Summary状态图标 进度百分比、Metrics 表格、Blockers Risks、Action Items 等章节对应状态场景摘要级指标 受阻项的判据。端到端示例是可复现的黄金参照examples/project-decision.md 完整演示了决策场景的理想执行先以带teamspace_id与日期过滤的notion-search命中 4 个相关页面再逐个notion-fetch提取要点随后产出含 4 个方案含Do Nothing利弊分析的 Pre-Read 与 16 个分组讨论问题的 Agenda最后用notion-create-comment通知参会者examples/executive-review.md 则展示状态类场景的 90 分钟高管评审议程如何按 15~20 分钟分块并链接 OKR 与指标看板。评测人员可以将这些示例的输出质量作为对标基准。小结Meeting Intelligence 技能评测体系的核心价值在于它把会议准备得好不好这种主观问题翻译成了可逐步执行、可逐条判定的技术验收标准。通过决策与状态两个 JSON 场景覆盖最典型的会议类型通过Notion 事实优先 → Codex 增值增强 → 双文档分离 → 结构合规 → 来源可溯五层行为检查评测人员可以在 Haiku、Sonnet、Opus 多模型下稳定复现验证并依循 评测 README 的扩展指南把头脑风暴、1:1、冲刺规划等更多会议类型纳入覆盖形成一套可持续生长的评测资产。【免费下载链接】skillsSkills Catalog for Codex项目地址: https://gitcode.com/GitHub_Trending/skills4/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考