
1. 从“功能堆砌”到“能力涌现”一次产品理念的升维最近我们团队内部完成了一次重要的产品迭代核心动作是将一个大家耳熟能详的“功能”模块正式升级并命名为“Skill 能力”。这听起来可能像是一次简单的改名但背后是我们对产品价值、用户需求以及技术架构长达数月的深度思考与重构。这次升级伴随着多模态记忆与检索体系的全面革新标志着我们的产品从提供离散的工具转向构建一个具备持续学习与进化潜力的“智能体”。在过去我们常常陷入一个误区用户需要什么我们就加什么。于是产品里塞满了各种“功能”一个笔记功能、一个待办功能、一个文件管理功能……它们彼此独立数据割裂。用户需要手动在不同功能间搬运信息处理复杂任务时就像在操作一台由不同厂商零件拼凑起来的机器每个零件都很好但组合起来却异常笨拙。我们意识到用户真正需要的不是一个功能清单而是一个能理解其意图、整合其信息、并主动提供支持的“伙伴”。这个伙伴需要具备的是“能力”而非孤立的“功能”。“Skill 能力”的正式上线就是我们向这个目标迈出的关键一步。它不再是一个让你“记笔记”或“存文件”的地方而是一个可以学习和调用你所有知识、经验与偏好的中枢。结合全面升级的多模态记忆与检索体系它旨在让信息不再是静态的档案而是能被动态理解、关联和应用的“活知识”。无论你是知识工作者、创意从业者还是希望提升个人效率的任何人这次更新都试图从根本上改变你与信息交互的方式——从“你找信息”变为“信息找你并为你所用”。2. 拆解“Skill 能力”它到底是什么能解决什么那么这个听起来有些抽象的“Skill 能力”究竟是什么呢我们可以把它理解为你数字世界中的一个“虚拟专家助理”。这个助理的核心特质是情境感知、记忆持久和行动执行。2.1 核心特质一情境感知与意图理解传统的功能是“盲”的。你打开一个笔记应用它不知道你正在写一份季度报告还是策划一次家庭旅行。Skill 能力则不同它通过分析你当前的工作上下文正在浏览的网页、正在编辑的文档、正在进行的对话、结合你的历史行为模式来理解你的“意图”。例如当你在阅读一篇关于市场趋势的行业报告时Skill 能力能识别出你处于“信息收集与分析”的情境中。它不会弹出一个无关的菜谱推荐而是可能会主动问“需要我帮你梳理近三个月同类报告的核心观点并生成对比摘要吗” 这种从“被动响应指令”到“主动理解并提议”的转变是能力与功能最本质的区别。2.2 核心特质二持久化与结构化的记忆记忆是能力的基础。一个健忘的助理毫无价值。我们全面升级的多模态记忆体系就是为了构建一个强大、可靠且易于调用的记忆库。这里的“多模态”意味着记忆的内容不限于文字文本记忆你阅读过的文章、写下的笔记、会议纪要中的关键结论。视觉记忆你保存的图表、设计草图、产品截图甚至是你用手机随手拍下的白板讨论照片。音频记忆重要的会议录音、访谈片段、你自己的语音备忘录。行为记忆你常用的工作流、对特定类型任务的处理偏好例如你总是喜欢先列大纲再写内容。关键在于这些记忆不是杂乱无章地堆在仓库里。升级后的体系会对它们进行深度的结构化处理提取实体人物、项目、概念、识别关系、总结要点、打上情境标签。这样当需要时系统不是进行简单的关键词匹配而是进行“语义检索”和“关联推荐”。比如当你开始策划一个新项目“A计划”时系统能自动关联起你半年前写的关于类似项目的复盘文档、上周保存的竞品分析图谱以及上个月与相关同事的会议录音摘要。2.3 核心特质三可组合与可调用的行动能力必须能落地为行动。Skill 能力提供了一系列基础“原子动作”并允许它们像乐高积木一样组合。这些原子动作可能包括总结一份文档、从多份材料中提取共识与分歧、根据模板起草邮件、生成待办清单、调用某个API获取数据等。你可以通过自然语言指令“帮我把这三次会议的要点合并成一份进展报告”或预设的自动化工作流来调用这些能力。更重要的是系统会学习你常用的组合方式将其固化为你的“个人技能”。例如经过几次操作系统学会了你“撰写技术博客”的技能流程先搜集近期技术动态 - 结合个人项目笔记生成大纲 - 调取合适的代码示例 - 初步润色语言风格。下次你只需说“准备写一篇关于容器网络的文章”它就能自动启动这个流程为你准备好大部分素材。注意Skill 能力的有效性高度依赖于初始的记忆数据积累和用户反馈。在早期可能需要你主动“喂养”一些信息并通过“做得对/不对”的反馈来训练它这是一个共同成长的过程无法一蹴而就。3. 多模态记忆与检索体系升级的技术内幕支撑Skill能力“聪明”表现的是底层记忆与检索系统的全面重写。这次升级绝非简单的性能优化而是在架构理念上的革新。我们可以从“记”、“存”、“取”三个环节来理解。3.1 “记”的维度从采集到理解过去的“保存”按钮只是将信息的原始副本丢进数据库。现在的“记忆”过程则是一个轻量级的实时理解流水线。多模态解析对于输入的任何内容网页、PDF、图片、音频系统会并行启动多个解析器。文本解析器进行分词、实体识别和语义分割图像解析器通过OCR提取文字并通过视觉模型识别图表类型、主体对象音频解析器先转文字再分析语音语调中的重点如语速加快、重复强调的部分。统一表征生成这是核心步骤。所有不同模态的信息最终都会被转化为一个高维空间中的“向量”Embedding。这个向量就像信息的“DNA”包含了其语义核心。一篇关于“项目管理”的文章和一张甘特图截图虽然模态不同但在这个向量空间里的位置可能会非常接近。我们升级了向量化模型使其对长文档、复杂图表和跨模态关联有了更好的理解能力。元数据与关联图谱构建系统会自动提取关键信息作为元数据如来源、时间、作者、涉及的项目/人物标签并尝试建立信息片段之间的关联。例如它会发现你保存的“2024年Q1销售数据.xlsx”与你写的“Q1市场总结”笔记高度相关并自动建立链接。这些关联构成了一个私有的知识图谱是进行深度检索和推理的基础。3.2 “存”的架构向量数据库与关系型数据库的协同记忆体系采用了混合存储架构以平衡效率、精度和复杂度。向量数据库用于存储所有信息的“向量DNA”。它的特长是进行快速的“相似性搜索”。当你想找“和当前文档类似的内容”时系统就在这个数据库里寻找向量距离最近的那些记忆。我们此次升级重点优化了向量的索引算法使检索速度提升了数倍并能支持更精确的近似度计算。关系型数据库用于存储结构化的元数据、用户标签、明确的关联关系如“文档A属于项目B”以及知识图谱中的实体和关系。它擅长处理精确查询和复杂的关系遍历。对象存储用于保存原始文件如图片、音频、PDF原件确保信息的完整性。当进行一次检索时系统可能会先利用向量数据库进行语义相似性初筛再结合关系型数据库中的图谱信息进行关联性扩搜和结果重排最终返回一个综合了“内容相似”和“逻辑相关”的结果列表。3.3 “取”的智能从关键词匹配到意图驱动检索传统的检索是你输入关键词系统返回包含关键词的结果。升级后的检索是“意图驱动”的。查询理解与扩展当你输入“帮我找找上次讨论的关于降低成本的那个点子”时系统首先会理解这是一个“查找历史讨论记录”的意图核心实体是“降低成本”、“点子”。它会自动进行查询扩展将“降低成本”关联到“降本增效”、“优化流程”、“削减开支”等同义或相关概念将“点子”关联到“建议”、“方案”、“脑暴结果”。同时它会结合你的当前上下文如果你正在一个名为“运营优化”的项目页面将“运营优化”作为加强权重的筛选条件。多路召回与融合排序系统会同时从多个“通道”召回结果语义通道在向量空间中搜索与查询向量最接近的记忆。关键词通道进行传统的关键词匹配作为兜底和精确匹配保障。图谱通道沿着知识图谱查找与“降低成本”这个实体直接或间接相关的所有节点如相关的会议、文档、人物。 然后一个复杂的排序模型Ranking Model会对所有召回的结果进行打分和重排。这个模型会考虑新鲜度最近的信息权重更高、权威度你反复查看或标注重要的信息权重更高、与当前情境的匹配度等多个因素给出最终排序。结果呈现与解释检索结果不再是简单的标题列表。系统会尝试生成一个简短的“摘要”解释为什么这条记忆被推荐给你。例如“推荐理由此条为2024年3月5日团队脑暴会议录音摘要其中‘张工’提出的‘采用云原生架构优化资源调度’方案与您当前查询的‘降低成本’相关度达92%且该会议属于‘运营优化’项目。”4. 实战如何从零开始构建你的第一个“个人技能”理解了原理我们来看如何实际运用。假设你是一名产品经理经常需要做竞品分析。我们可以尝试构建一个“竞品分析助手”技能。4.1 第一步喂养记忆建立知识库任何能力都始于记忆。你需要有意识地、系统地向Skill能力“喂养”相关的高质量信息。导入原始资料将你收集的竞品官网截图、产品手册PDF、行业分析报告、用户评测文章等通过浏览器的“保存到记忆”插件或直接上传的方式存入系统。不要担心杂乱系统会进行解析。主动标注与关联在保存时或之后花几分钟添加一些关键标签。例如为所有关于“产品A”的资料打上#竞品/A的标签为关于“定价策略”的资料打上#分析维度/定价的标签。你还可以手动建立一些强关联比如把“产品A的2024年Q2更新日志”和“产品A的第三方评测”关联起来。记录你的分析过程当你自己撰写竞品分析报告时直接在Skill能力支持的编辑器里写。你的思考过程、对比表格、最终结论都会成为系统学习“如何做竞品分析”的宝贵素材。特别是当你从多份资料中提炼出一个观点时这个“提炼”的动作和结果会被系统特别关注。4.2 第二步定义技能流程与触发条件当记忆库有了一定基础后你可以开始定义技能。技能描述在Skill能力设置中创建一个名为“竞品分析简报生成”的新技能。用自然语言描述它“当我需要快速了解某个竞品或某个功能领域的竞争格局时自动搜集我记忆库中的相关信息并生成一份结构化的分析简报。”设置触发条件触发方式可以很灵活手动触发在任何界面通过输入“/”命令呼出技能列表选择“竞品分析简报生成”。自动触发设置规则。例如“当我在笔记中提到‘竞品分析’、‘vs’、‘对比’等关键词时在侧边栏提示我可使用此技能”。情境触发当你浏览一个被识别为竞品的网站时浏览器插件可以自动浮窗问询“需要为这个产品生成分析简报吗”配置执行动作这是技能的核心。你需要定义这个技能具体做什么。通常这是一个动作链动作1信息收集基于我输入的竞品名称或功能关键词在记忆库中进行多模态检索召回相关的所有资料文章、截图、图表、我的旧笔记。动作2信息整合调用“总结与归纳”原子能力对召回的资料进行去重、归纳核心观点、提取数据如版本号、价格、上线时间。动作3结构化输出按照你预设的模板如概述、功能对比、优势劣势、市场动态、我的洞察将整合后的信息填充进去生成一份草稿。动作4交付将生成的草稿插入到我当前编辑的文档中或创建一个新的笔记。4.3 第三步使用、反馈与迭代优化技能创建后关键在于使用和训练。首次使用与校准第一次使用时系统生成的结果可能不尽如人意。比如它可能漏掉了一份重要的财报或者对比的维度不是你关心的。这时你需要进行反馈。提供精确反馈不要简单地说“不好”。而是应该指出具体问题“漏掉了2023年11月产品B发布的关于‘智能客服’的更新日志”或者“请把‘性能指标’这个对比维度加进去并从我保存的基准测试报告中提取数据”。你的每一次反馈都是在“教”系统你的偏好和标准。观察技能的进化随着使用次数和反馈的增多你会发现这个技能越来越“懂你”。它开始能自动识别你关心的分析维度优先采用你信任的数据来源生成的简报结构也愈发贴合你的习惯。这个过程就是技能从“通用工具”进化为你的“个人专属助理”的过程。个人心得在构建技能的初期不要追求大而全。从一个非常具体、高频的小任务开始比如“生成周报要点”、“整理会议待办”成功率更高反馈闭环更快你也能更快地建立起对这套系统的信心和感知。贪多嚼不烂一个打磨精良的小技能远比十个粗糙的大技能有用。5. 升级背后的挑战与我们踩过的“坑”这次升级并非一帆风顺。从“功能”思维转向“能力”思维并在工程上实现多模态记忆与智能检索我们遇到了不少预料之中和预料之外的挑战。5.1 挑战一用户意图的模糊性与歧义性这是最大的NLP自然语言处理难题。用户的指令往往是模糊、简略且充满歧义的。例如“帮我找一下上次说的那个东西”。“上次”是什么时候“说的”是会议、聊天还是邮件“东西”是文档、链接还是一个想法我们的解决方案是多层消歧强上下文绑定优先将指令与用户当前最活跃的“工作上下文”当前项目、最近编辑的文档、正在进行的聊天线程进行关联。交互式澄清当系统置信度不足时不再返回一个可能错误的结果列表而是主动发起澄清对话。例如它会问“您指的是昨天项目复盘会上提到的‘技术选型方案’还是上周与李四私聊时提到的‘团建想法’” 虽然增加了一步交互但准确率大幅提升用户体验反而更好。个性化意图模型基于用户的历史行为数据训练轻量级的个性化意图识别模型。例如对于某位设计师“找参考”大概率指找图片对于某位程序员“找参考”则可能指找代码库。这个模型会随着时间不断进化。5.2 挑战二多模态数据对齐与融合的噪音将图片、文字、音频统一变成向量听起来很美但实际操作中噪音极大。一张复杂的架构图OCR提取的文字可能是支离破碎的一段带有背景音乐的会议录音转写的文字可能错误百出。如果直接用这些有噪音的文本去生成向量会导致记忆“失真”。我们采取的应对策略是“分层处理与置信度加权”预处理与清洗对OCR和ASR语音识别的结果进行后处理包括纠错、分段、去除无意义字符。对于图像除了OCR文字还会提取视觉特征向量描述图像的整体风格、主体对象。多向量表示一个重要记忆体可能拥有多个向量表示基于清洗后文本的向量、基于视觉特征的向量、甚至基于音频频谱特征的向量。检索时的融合在检索时根据查询类型动态调整不同模态向量的权重。如果用户查询是“找一张柱状图”则视觉特征向量的权重调高如果查询是“找讨论‘预算’的部分”则文本向量的权重调高。同时系统会为每个记忆片段计算一个“质量置信度”分数低置信度的片段在排序中会被降权。5.3 挑战三隐私、安全与性能的平衡记忆系统存储了用户最私密的工作和生活信息。安全和隐私是红线但强大的检索能力又需要一定的数据访问和计算。端侧优先与差分隐私所有敏感信息的向量化计算尽可能在用户设备端如桌面客户端、手机App完成原始数据不上传。必须上传云端进行复杂处理的数据如超长音频的深度分析采用差分隐私技术在数据中加入精心计算的噪声使得单个用户的原始信息无法被还原但整体模型仍能从中学习到有效模式。权限与隔离记忆严格按用户、按项目进行隔离。团队共享记忆需要明确的授权。所有检索操作都经过严格的权限校验确保用户只能访问自己被授权的内容。索引与查询的优化为了应对海量记忆数据下的检索性能问题我们自研了分层索引结构。高频、近期记忆使用内存加速索引全量记忆使用磁盘优化索引。查询时采用“倒排索引向量索引”的混合检索框架先快速缩小范围再进行精确但耗时的向量相似度计算确保在毫秒级返回结果。5.4 一个具体的“踩坑”案例向量空间的“概念漂移”在早期测试中我们发现一个奇怪的现象用户上周保存的关于“敏捷开发”的文章这周用同样的词去搜竟然排不到前面了反而一些不那么相关的内容出现了。经过排查这不是bug而是一个被称为“概念漂移”的机器学习典型问题。我们的向量化模型为了追求更好的整体效果会定期用新数据重新训练或微调。然而模型参数的微小变化可能导致整个向量空间的几何结构发生轻微扭曲。上周“敏捷开发”文档所在的向量位置这周可能被另一类文档“占据”了而它自己则漂移到了不远处。我们的解决方案是引入“锚点”和“持续学习”机制设置用户锚点系统会秘密地选取一批用户明确标记为“重要”或反复访问的记忆片段作为“锚点”。在模型更新后会检查这些锚点记忆在新旧向量空间中的相对位置关系是否保持稳定。如果发生较大漂移则触发警报。个性化向量微调在全局模型的基础上为每个用户维护一个极轻量级的“偏置”模型。这个模型的作用不是重新学习所有知识而是学习将全局向量空间“校正”到符合用户个人语义习惯的方向。例如在全局模型中“苹果”可能更接近“水果”但对于一位科技行业用户他的偏置模型会学习将“苹果”向“公司”、“手机”方向拉近一点。这个偏置模型随着用户的使用持续在线学习有效对抗了全局概念漂移对个人体验的影响。混合检索兜底即使向量检索因漂移出现偏差我们还有基于关键词和知识图谱的检索通道作为兜底确保最基本的相关性不会丢失。这次踩坑让我们深刻认识到构建一个活的、会学习的系统运维和监控的复杂度远超静态系统。我们需要像照顾一个孩子一样持续观察它的“成长”并及时进行引导和纠正。6. 展望Skill能力的未来与生态想象Skill能力的上线只是一个起点。我们看到的未来是一个由无数个性化、可组合的“能力”构成的生态系统。6.1 能力的可分享与市场化未来用户打磨精良的个人技能如“某某风格的产品需求文档写作助手”、“投资标的初筛分析流程”可以选择加密后分享给团队其他成员甚至发布到一个“技能市场”。其他用户可以订阅、导入这些技能并根据自己的记忆库进行微调快速获得一个高起点的专业助手。这可能会催生一批“技能创作者”他们不是程序员但善于总结工作流和知识体系并能将其产品化为可复用的能力。6.2 跨应用的能力调用真正的能力不应被禁锢在一个应用内。我们正在探索通过安全的标准化协议例如基于OAuth2.0和特定动作规范的API让Skill能力可以受用户授权在其他合规的应用中被调用。想象一下你在幻灯片软件里写报告可以直接调用你记忆库中的数据和图表生成技能在邮件客户端里可以调用你的“邮件礼仪与措辞优化”技能。能力将像水电一样成为数字办公环境的基础设施。6.3 从“记忆检索”到“记忆推理”目前的系统主要还停留在“记忆的检索与重组”阶段。下一步我们希望引入更轻量级的推理模型让系统不仅能找到信息还能基于找到的信息进行简单的逻辑推理、假设生成和方案建议。例如当你输入“产品A和B都在降价我们的定价策略该如何调整”时系统不仅能找出A和B的历史价格数据、市场分析报告还能结合你公司的成本结构和市场定位文档推理出几个可能的策略方向及其潜在利弊供你决策参考。这将是能力从“信息助理”向“思维伙伴”迈进的关键一步。这次升级是一次漫长的旅程其价值不会在第一天就完全显现。它需要你我们的用户一起投入时间去“培养”你的数字助理。开始可能会有些笨拙反馈可能显得繁琐但请相信随着你们彼此熟悉的加深它会变得越来越贴心、越来越强大。我们构建的不是一个冰冷的工具而是一个有潜力与你共同成长的伙伴。现在技能已经上线记忆体系已经就绪是时候开始构建属于你自己的、独一无二的数字能力中枢了。