ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

可观测性开箱即用:Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析

可观测性开箱即用:Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析 可观测性开箱即用Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析【免费下载链接】archestraEnterprise AI Platform with guardrails, MCP registry, gateway orchestrator项目地址: https://gitcode.com/gh_mirrors/ar/archestraArchestra 是企业级 AI 平台带 AI 护栏、MCP 注册中心、网关与编排器它的可观测性开箱即用内置 OpenTelemetry 分布式追踪、Prometheus 指标暴露与 OTLP 日志导出配合官方 Grafana 仪表盘无需自研监控代码就能看清每一次 LLM 调用的延迟、Token 消耗与成本。本文带你完整走查这套 可观测性体系 的三大支柱。为什么 AI 平台需要一套完整的可观测性传统 Web 应用看 QPS 和错误率就够了但 AI 平台多了一个钱袋子和黑盒子成本不可见一次对话可能触发多轮 LLM 调用和 MCP 工具执行不追踪就不知道哪个 Agent 在烧钱延迟难归因用户抱怨慢到底是模型首 Token 慢还是平台自身的鉴权、护栏、工具调度慢行为难审计Agent 调用了哪些工具、传了什么参数、模型回了什么出问题时拿不出证据Archestra 用 OpenTelemetryOTel Prometheus Loki 这套业界标准组合回答了以上三个问题且全部以标准协议导出——你可以接 Jaeger、Tempo、Grafana Cloud 等任意 OTLP 兼容后端。一张图看懂指标、追踪、日志三条管道Archestra 的可观测性数据流向如下Web 进程在http://localhost:9050/metrics暴露 Prometheus 格式指标独立的Worker 进程Helm 部署默认形态在:9000/metrics暴露任务队列与知识库流水线指标追踪与日志统一通过 OTLP 协议发到 OpenTelemetry Collector默认http://localhost:4318追踪走/v1/traces日志走/v1/logsCollector 将追踪写入Grafana Tempo、日志写入Loki再由 Grafana 统一呈现仓库里附带了一套开箱即用的开发环境编排一条命令拉起 Tempo、Loki、OTel Collector、Prometheus、Grafana 全家桶编排文件docker-compose.observability.ymlPrometheus 抓取配置prometheus.yml每 10 秒抓取一次 Archestra 指标Collector 管道配置otel-collector-config.yamlPrometheus 指标全解LLM 成本与延迟一眼看清核心 LLM 指标建议优先关注指标名含义llm_request_duration_secondsLLM 请求耗时可按 provider、model、agent、状态码细分llm_tokens_totalToken 消耗input/output 分开计数llm_cost_total美元成本估算真实计费口径用sum(llm_cost_total{billing_modemetered})llm_time_to_first_token_seconds首 Token 时间TTFT挑低延迟模型的好依据llm_time_to_first_byte_seconds首字节时间含平台自身鉴权/护栏开销与 TTFT 对比即可分离平台慢还是模型慢llm_tokens_per_second输出吞吐tokens/sllm_active_users24h/7d 活跃用户数跨副本聚合请用max()而非sum() 小技巧llm_cache_tokens_total、llm_cache_savings_total还能单独追踪提示词缓存省了多少钱对重度使用长 System Prompt 的团队很实用。其他值得接入告警的指标组MCP 指标mcp_tool_calls_total、mcp_tool_call_duration_seconds追踪工具调用成功率与耗时mcp_server_deployment_status可统计自托管 MCP 服务器处于 running / hibernated 等状态的数量RAG / 知识库指标rag_connector_syncs_total、rag_embedding_batches_total、rag_query_duration_seconds覆盖同步、向量化到检索的全链路任务队列指标task_queue_tasks_dead_total进入死信队列是最该告警的信号应用层指标HTTP 请求直方图、Node.js 事件循环滞后nodejs_eventloop_lag_seconds、V8 堆内存、进程 CPU/内存OpenTelemetry 分布式追踪LLM 调用的全链路视角只需一个环境变量开启ARCHESTRA_OTEL_EXPORTER_OTLP_ENDPOINThttp://your-collector:4318支持 Bearer / Basic 认证ARCHESTRA_OTEL_EXPORTER_OTLP_AUTH_*系列变量不配置则匿名导出。默认追踪什么默认只采集 GenAI 相关的干净追踪避免噪音LLM API 调用——专属 Span 记录模型、Token、耗时命名如chat gpt-4o-miniMCP 工具调用——execute_tool {tool_name}含被护栏拦截mcp.blockedtrue的决策记录知识库操作——Embedding / Rerank 调用同样有 Span 与成本追踪Skill 沙箱执行——Rust 原生运行时导出service.namearchestra-sandbox-rs的 Span需要看 HTTP 路由等基础设施细节时设置ARCHESTRA_OTEL_VERBOSE_TRACINGtrue会话级统一追踪一次对话一棵树内置 Chat 的每轮对话会生成一棵统一的追踪树chat {agentName} ← 父 Span ├── chat {model} ← LLM 调用 ├── execute_tool {工具名} ← MCP 工具执行 └── chat {model} ← 工具结果后的追问通过X-Archestra-Session-Id头传入会话 ID即可按gen_ai.conversation.id把同一 Agent 会话的所有调用聚合到一条时间线上无论入口是 Chat UI、A2A 协议、MS Teams 还是 Emailroute.category与archestra.trigger.source都能帮你按渠道过滤。两个实用特性内容捕获默认把 Prompt / Completion / 工具参数与结果记录为 Span 事件单事件截断至 10,000 字符便于完整审计可用ARCHESTRA_OTEL_CAPTURE_CONTENTfalse关闭。若启用了静态内容加密该项默认自动关闭防止密文数据库的内容以明文外泄指标跳追踪Exemplars所有 LLM 与 MCP 指标都携带追踪示例点在 Grafana 中点击某个指标数据点可直接跳转到 Tempo 中对应的 Trace——从发现异常到定位请求只需一次点击日志体系从 OTel Collector 到 Loki 的闭环Archestra 的日志不走各容器 stdout 各自为政的老路OTel Collector 统一接收 OTLP 日志并转发到 LokiLoki 3.x 原生支持 OTLP 摄取开发环境的管道在 otel-collector-config.yaml 中定义。Grafana 数据源配置还开启了traces-to-logs 双向跳转从一条追踪按service.name标签直接捞出相关日志见 datasources.yml。真用户监控RUM把用户怎么用也变成日志除基础设施遥测外Archestra 还支持Real User Monitoring企业版功能浏览器端事件经后端转发为你的 OTLP 日志记录只需设置ARCHESTRA_RUM_EXPORTER_OTLP_ENDPOINThttp://your-collector:4318捕获的事件是封闭白名单——session.start、page_view、Core Web VitalsLCP/CLS/INP、主线程长任务、客户端错误指纹、API 请求耗时等且不包含聊天内容、姓名、原始 URL 等敏感信息隐私友好。在 Grafana Loki 中按{service_nameArchestra Web}查询即可搭建用量看板5 个官方 Grafana 仪表盘克隆即用平台内置 5 个覆盖全场景的仪表盘 JSON位于 platform/dev/grafana/dashboards/仪表盘关注点GenAI ObservabilityLLM 请求、Token、成本、延迟与追踪MCP Monitoring工具调用成功率、错误率、耗时Agent Sessions会话级审计可下钻 LLM 调用 / 工具调用 / 关联日志Application MetricsHTTP 流量、Node.js 健康、任务队列、PostgreSQLRAG Knowledge Base连接器同步、Embedding 管道、检索性能配合 install-dashboards.sh 脚本可一键导入全部仪表盘幂等可重复执行并通过--postgres-provider适配 OTel Collector / Cloud SQL / Azure 等不同数据库指标来源。快速上手三步搭好最小可观测性环境启动全家桶运行docker compose -f platform/dev/docker-compose.observability.yml up -dGrafana 监听 3002 端口指向 Collector给 Archestra 后端设置ARCHESTRA_OTEL_EXPORTER_OTLP_ENDPOINT本地开发时默认http://localhost:4318即可验证闭环发起一次 Chat 对话 → 打开 Grafana 的 GenAI Observability 面板 → 点击llm_request_duration_seconds的某个数据点 → 通过 Exemplar 直达 Tempo 中的完整追踪 → 再按 trace ID 捞出 Loki 日志 生产环境Helm 部署提醒worker 是独立进程请确保抓取配置同时覆盖 web 的:9050与 worker 的:9000两个指标端点否则任务队列与知识库流水线指标会缺失。小结Archestra 把企业级 AI 平台最头疼的看得见、算得清、查得到做成了默认能力Prometheus 指标回答花了多少钱、快不快OpenTelemetry 追踪回答这次调用到底发生了什么Loki 日志与 RUM回答用户和产品实际表现如何。三者共享同一套 OTLP 管道与 Grafana 呈现层标准协议意味着你可以随时替换后端而不必改动一行平台代码。 更多细节请查阅官方文档platform-observability.md部署相关环境变量见 platform-deployment.md 的Observability Metrics章节。【免费下载链接】archestraEnterprise AI Platform with guardrails, MCP registry, gateway orchestrator项目地址: https://gitcode.com/gh_mirrors/ar/archestra创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表