可观测学堂

可观测技术指南

从概念、接入到生产治理,提供可执行、可验证的工程方法。

模型能力比较与评估插画
技术指南

Playwright CLI 与 MCP:AI Agent 的浏览器自动化怎么接?

让 AI 编码 Agent 操控浏览器有两条路:常驻的 Playwright MCP Server,或按需执行的 Playwright CLI。本文对比两种架构的上下文开销、状态管理与适用场景。

模型能力比较与评估插画
技术指南

Stoolap 与 SQLite 对比:嵌入式 SQL 引擎的选型边界

比较 Stoolap 与 SQLite 的存储、事务和分析查询,不把单项性能宣传当成通用优势。

模型能力比较与评估插画
技术指南

GPT-5.6 模型家族与 Ultra 模式解读

依据 OpenAI 公开发布资料解释 GPT-5.6 Luna、Terra、Sol 与 max、ultra 设置,区分产品编排、API 接入和任务费用。

模型能力比较与评估插画
技术指南

Claude Opus 4.5:发布定价、effort 与迁移评估

回顾 Claude Opus 4.5 发布时的标准 Token 单价、effort 参数与官方软件工程评测,区分历史报价、基准结果和实际任务成本。

模型能力比较与评估插画
技术指南

苹果开源 STARFlow 模型详解:自回归 + 流的图像生成新架构

介绍苹果 STARFlow 自回归流模型与公开图像、视频实现,区分潜空间可逆性、VAE 重建和实际推理成本。

模型能力比较与评估插画
技术指南

Grok 4.1:历史能力与 API 迁移注意事项

回顾 Grok 4.1 与 4.1 Fast 的发布定位、工具使用和模型差异,说明 Fast API 退役、别名重定向及迁移核对事项。

智能体工具协作与任务执行插画
技术指南

BettaFish 详解:多智能体舆情分析系统的架构与边界

BettaFish 是开源的多智能体舆情分析系统:多 Agent 协作采集与分析视频、图文、新闻数据,输出舆情洞察。本文拆解其架构、能力与法律伦理边界。

模型能力比较与评估插画
技术指南

Gemini 3 Flash:效率定位与质量评估

依据 Google 官方发布资料理解 Gemini 3 Flash,并给出编码、时延、费用与事实错误的评估方法,不虚构幻觉率。

模型能力比较与评估插画
技术指南

GPT-5.4 特性与基准全景解读

依据官方资料介绍 GPT-5.4 的编码、推理与工具使用能力,区分模型、宿主工具、产品交互和快速模式的适用条件。

智能体工具协作与任务执行插画
技术指南

Google Workspace CLI(gws):为 AI Agent 设计的命令行

介绍 Google Workspace CLI 的 JSON 输入、结构化输出与 Discovery 命令生成,说明非官方支持状态、认证及 Agent 权限边界。

智能体工具协作与任务执行插画
技术指南

Interfaze:文档感知、编排与结构化抽取

理解 Interfaze 的感知与编排架构、OCR 和结构化输出能力,并区分格式约束、字段正确性与置信度校准。

智能体工具协作与任务执行插画
技术指南

Terax 终端:Tauri 2、Rust 与 AI 工作流

介绍 Terax 的终端、编辑器和 AI 集成,说明 WebGL 渲染、本地与云端模型的数据边界,不把包体积和启动宣传当实测。