首页/新闻资讯/正文详情

FluentRead 模型用量统计完全指南:看懂 Token、输出速度与请求记录

发布时间:2026/9/27 21:17:55 来源:云帆数科 栏目:资讯中心
FluentRead 模型用量统计完全指南:看懂 Token、输出速度与请求记录
前端AI 应用本地部署【免费下载链接】FluentReadAn open-source browser extension for bilingual translation. 一款开源的浏览器双语翻译插件。项目地址https://gitcode.com/gh_mirrors/fl/FluentRead点击查看免费下载FluentRead 是一款开源的双语翻译浏览器插件在调用各类 AI 翻译服务时会以事件形式记录每次模型调用的用量信息并在设置页的「模型用量」面板中呈现。本文以该面板为核心完整讲解 Token 的含义与统计口径、时间范围与趋势的查看方式、输出速度token/s的计算规则、请求记录的管理与隐私边界并结合仓库源码说明每一项数据背后的实现原理帮助你准确读懂本机统计、排查失败请求并合理控制模型消耗。打开模型用量面板在 FluentRead 的设置页面中打开模型用量即可看到当前浏览器近期调用过的 AI 服务与模型、请求次数、成功情况以及 Token 用量。面板顶部提供了三个维度的筛选条件服务从「全部 AI 服务」下拉框中选择某个翻译服务如 OpenAI、Moonshot、DeepSeek 等查看该服务的用量模型在选定服务后可进一步收窄到某个具体模型未选服务时展示全部模型时间范围今日、7 天、30 天三档对应源码中的Range today | 7d | 30d见 types.ts。选择好范围后概览区会展示四张核心卡片Token 使用量含输入、输出拆分、模型请求成功/错误/超时/取消数量、平均输出速度token/s与缓存读取比率。需要说明的是这套统计完全保存在当前浏览器本地面板页头明确标注「本机」并提示「仅统计当前浏览器保留的最近 1,000 次模型调用」对应源码常量MODEL_USAGE_MAX_STORED_EVENTS 1_000见 types.ts。它不等同于服务商账号下的全部历史用量也不是剩余额度查询。Token 是什么输入、输出与计量的边界面板中大量出现 Token 数值理解其含义是读懂统计的第一步Token 是模型处理文字的计量单位而非自然语言中的字数或单词数。同一段中文不同模型切分出的 Token 数量可能不同输入input是发给模型的内容包括提示词与待翻译文本输出output是模型生成的回答译文或摘要总计total一般由服务商返回可能包含输入、输出之外的成分。一个容易被忽略的事实是Token 不等于计费金额。模型服务商的计价规则单价、是否含缓存优惠、免费额度抵扣顺序等各不相同面板中展示的 Token 只是用量参考「你的服务商账单才是费用的唯一权威来源」。从源码看事件模型为每次调用保存了inputTokens、outputTokens、totalTokens、cachedInputTokens缓存读取、cacheWriteTokens缓存创建与reasoningTokens推理等多个字段见 types.ts。聚合层在计算时会对每个字段做安全校验非负整数才计入并通过usageAvailability标记「已上报 / 未上报 / 格式异常」三种状态见 aggregation.ts。看一段时间的变化趋势、构成与缓存拆分选择时间范围后趋势图会按「今日」逐小时、「7 天 / 30 天」逐日绘制对应 aggregation.ts 中的buildTimeline。聚合按本地日界线分桶今日视图基于真实经过的时钟小时推进夏令时切换日会自然得到 23 或 25 个唯一桶不会错位。趋势图支持在Token与请求次数两个指标间切换Token 视角柱形按「输入未命中缓存」「缓存读取」「输入缓存情况未知」「输出」「其他 Token」分段着色每种颜色代表一类用量构成见 insights.ts 的buildUsageComposition请求次数视角柱形按成功、错误、超时、取消四种结果分段。点击任意柱形即可查看该小时/该日的输入、输出、请求数等明细也可用方向键在柱形之间切换←/→、Home、End。关于缓存需要明确三条口径缓存读取属于输入的一部分已包含在输入 Token 中面板会将其单独拆分展示缓存命中率与缓存覆盖率的计算仅基于服务商明确上报缓存明细的调用未上报缓存数据的调用不计入分母的「可计算请求」若服务商返回的「上报总计」与「输入 输出组成合计」不一致面板不会伪装差异差异会被单列为「其他 Token」若为负则不展示负数分段并在图例下方提示「上报总计与组成不一致柱高按组成绘制」对应 insights.ts 的differenceTokens。什么会计入统计并非每一次网络活动都会出现在面板中。从源码与界面说明可以确认已纳入统计的 AI 请求包括常规 AI 翻译单句、整页、文档、字幕等多段翻译任务部分连接检查connection-test用途与失败后的重试阅读理解、页面摘要、写作助手等其他调用场景ModelUsagePurpose枚举见 types.ts。不会完整出现在面板中的情况包括服务商未返回用量明细的请求显示为「未上报」或「格式异常」尚未接入统计的功能模块在其他设备其他浏览器、手机 App上发生的调用。因此面板中的「Token 上报率」值得关注当存在未上报 Token 的调用时面板会提示「N 次调用未提供 Token总量仅包含已上报部分」总量不会对缺失值做任何估算补全源码注释明确「未上报的用量不作估算」见 ModelUsageDashboard.vue。输出速度token/s规则与例外输出速度是面板中最容易被误读的指标其定义与计算规则非常严谨输出速度token/s 可计算成功请求的输出 Token 总和 ÷ 这些请求的耗时总和秒包含等待与传输时间不是纯生成速度。从源码可精确还原这一口径见 aggregation.ts 的requestOutputTokensPerSecond只有同时满足以下四个条件的事件才参与计算——结果为成功outcome success用量已上报usageAvailability reported输出 Token 为有效非负整数耗时为有效正数durationMs 0。其中durationMs是单次调用的完整耗时天然包含首字等待TTFB与网络传输因此面板上的 token/s 是「端到端吞吐」而非模型自身的生成速度。对应的展示规则为缺失输出或有效耗时 → 显示—输出为零 → 显示0概览卡片展示平均速度与可计算请求数请求明细的每一行展示单次请求的速度服务与模型分布中的每一行展示该服务/模型的平均输出速度。注意平均耗时的统计口径与输出速度不同它包含全部调用成功与失败用于衡量整体延迟水平。服务与模型分布谁产生了这些 Token「服务与模型分布」区块按服务 模型分组展示各组合的用量默认按 Token 总计降序排列也可切换为按输入、缓存、输出或请求次数排序对应 ModelUsageDashboard.vue 的排序选项。每一行展示输入 Token、缓存读取 Token未上报则显示—、输出 Token请求次数与总计 Token该行的平均输出速度token/s一条与「最大 Token 占比」成正比的横向比例条。点击任意一行即可直接筛选面板立即切换到该服务 模型的视角模型下拉框也会联动收窄。点击「重置筛选」可回到全部服务、全部模型、30 天的默认视图。从聚合实现看分布表由buildBreakdown生成按服务 ID 与模型名分组再按总 Token、输入、输出、请求数依次排序见 aggregation.ts。模型名优先取实际调用模型actualModel其次取配置模型两者不同时请求记录中会同时展示「配置模型」供比对见 types.ts。请求记录逐次调用的体检报告请求记录默认展开展示当前筛选条件下每一次模型调用的明细每条记录包含发起时间本地化格式服务 / 模型含配置模型与实际模型不一致的提示场景翻译、页面摘要、连接测试、阅读理解、写作助手状态成功、错误、超时、已取消附 HTTP 状态码耗时毫秒 / 秒 / 分秒格式化输出速度token/sToken 明细输入、缓存读取含输入命中率、输出、总计若服务商上报了缓存创建或推理 Token会在下方额外展示。记录支持三重筛选场景、状态成功/错误/超时/已取消与缓存状态已命中/未命中/未上报并支持每页 20 / 50 / 100 条分页对应常量MODEL_USAGE_REQUEST_PAGE_SIZE与MODEL_USAGE_REQUEST_MAX_PAGE_SIZE见 types.ts。值得注意的细节是游标分页请求记录按startedAt id组成稳定倒序游标翻页期间即使产生了新请求也不会导致旧记录被跳过或重复见 types.ts 与 ModelUsageDashboard.vue。此外第一页返回的总数会被固定避免持续产生的新请求导致页数漂移。请求记录本质上是一条请求与用量历史不是全文翻译存档——面板只记录时间、服务、模型、场景、状态、耗时与服务商返回的 Token明确不保存原文、译文、提示词、网页地址、API Key、请求体或响应正文见 ModelUsageDashboard.vue 的隐私声明组件也只在设置页通过后台白名单消息读取统计不直接访问 IndexedDB。管理记录导出、清除与隐私边界用量记录保存在当前浏览器中面板提供以下管理操作刷新重新读取后台聚合的最新统计快照清除统计弹出确认对话框删除本机请求记录及其汇总。对话框明确提示不会删除API Key、翻译设置、FluentRead 译文缓存或配置历史且操作无法撤销导出 / 导入通过后台消息协议export/import动作以fluentread-model-usage格式导出或恢复记录对应 modelUsage.ts。导出的数据不携带派生的模型字段导入时从实际/配置模型重新计算。两个容易误解的边界需要强调清除记录不会撤销服务商已经产生的费用——计费发生在服务商侧本机统计只是观察窗口导出的是请求与用量历史而非翻译全文需要完整翻译存档时应依赖其他机制。从安全角度看后台处理器会校验消息发送方必须是设置页 URL非设置页上下文直接拒绝访问isOptionsUrl校验见 modelUsage.ts并在接收端对筛选字段、游标、分页上限做严格校验对应 tests/modelUsageHandler.test.ts 中的权限与参数测试。如何减少模型用量如果发现 Token 消耗偏高可以从两个方向入手只翻译需要的句子避免整页翻译改用划词翻译或单句翻译关闭不需要的 AI 精翻在不需要时关闭 AI 精翻等额外 AI 上下文功能。更完整的服务选择与配置方法参见翻译服务配置指南中文版见 docs/config/translation-engines.md。注意不同服务商的 Token 单价、免费额度与缓存计费规则不同最终费用请以服务商后台账单为准。常见问题速查为什么面板显示—而不是速度数值输出速度只在「成功 已上报 输出有效 耗时有效」的请求上计算缺失输出或有效耗时显示—输出为零显示0。为什么总量比所有请求加起来的 Token 少部分调用未上报 Token显示为「未上报」或「格式异常」总量只包含已上报部分面板会用「Token 上报率」提示这一情况。为什么清除统计后费用没有减少本机统计仅用于观察计费由服务商完成清除记录不影响已产生的费用。为什么其他设备上的用量看不到统计仅保存在当前浏览器跨设备使用不会同步到本机面板需以服务商账单核对整体用量。为什么请求记录翻页后数量变了第一页的总数会被固定用于分页展示新产生的请求不会让已浏览的页数漂移刷新面板后可看到最新的总量。小结FluentRead 的模型用量面板是一套完整的本机可观测体系从事件采集、严格校验的 Token 聚合到按小时/按日的时间线、服务与模型分布、游标分页的请求日志再到受保护的导入导出与清除能力均由 src/services/model-usage聚合与数据合同、src/features/model-usage展示与格式化、src/app/background/handlers/modelUsage.ts消息协议三层协作完成。理解 Token 口径、输出速度定义与「未上报不估算」的边界就能把这份统计当作排查翻译失败、评估模型成本与优化调用量的可靠依据——但涉及真实费用时请始终以服务商账单为准。赞分享前端AI 应用本地部署【免费下载链接】FluentReadAn open-source browser extension for bilingual translation. 一款开源的浏览器双语翻译插件。项目地址https://gitcode.com/gh_mirrors/fl/FluentRead点击查看免费下载相关推荐FluentRead 模型用量完全指南看懂 Token 统计、输出速度与请求记录精准掌控 AI 翻译成本FluentRead 模型用量完全指南看懂 Token 统计、输出速度与请求记录精准掌控 AI 翻译成本 本文是 FluentRead开源双语翻译浏览器插前端AI 应用本地部署Codex-X 用量统计指南看懂 Token 趋势、模型分布与缓存命中率Codex X 用量统计指南看懂 Token 趋势、模型分布与缓存命中率 Codex X 是一款面向 OpenAI Codex 桌面端 / CLI 的可视化管桌面应用开发者工具AI 应用MiniMind推理结果解析token生成过程分析MiniMind推理结果解析token生成过程分析 引言从输入到输出的机制解析 你是否曾好奇当输入Hello时MiniMind如何生成World人工智能大模型预训练微调强化学习模型蒸馏AI Agent工具调用模型推理服务模型评测上一篇解决kube-prometheus常见问题从指标缺失到告警不触发的排查技巧下一篇LEEAlert性能优化如何避免弹窗导致的界面卡顿创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

MikroORM 级联操作完全指南:persist、remove、孤儿移除与数据库引用完整性
MikroORM 级联操作完全指南:persist、remove、孤儿移除与数据库引用完整性

后端 【免费下载链接】mikro-orm TypeScript ORM for Node.js based on Data Mapper, Unit of Work and Identity Map patterns. Supports MongoDB, MySQL, MariaDB, MS SQL Server, PostgreSQL and SQLite/libSQL databases. 项目地址: https://gitcode.com/gh_mir… · 2026/9/27 21:17:55

GPT-5.6 Sol登顶Arena Frontend、Gemma 4推理提速5倍、Claude Code内置浏览器 | 7月11日 AI日报
GPT-5.6 Sol登顶Arena Frontend、Gemma 4推理提速5倍、Claude Code内置浏览器 | 7月11日 AI日报

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 21:17:48

Linux Gstreamer深度解析之gst_audio_decoder_set_latency调用流程与实战(四十二)
Linux Gstreamer深度解析之gst_audio_decoder_set_latency调用流程与实战(四十二)

简介: CSDN博客专家、《Android系统多媒体进阶实战》作者 博主新书推荐:《Android系统多媒体进阶实战》🚀 Android Audio工程师专栏地址: Audio工程师进阶系列【原创干货持续更新中……】🚀 Android多媒体专栏地址&a… · 2026/9/27 21:17:48

3个外贸建站实战案例拆解做外贸的收入一般多少
3个外贸建站实战案例拆解做外贸的收入一般多少

3个外贸建站实战案例拆解做外贸的收入一般多少 很多新手运营盯着后台数据发愁,明明流量不错,询盘却寥寥无几,甚至不知道 做外贸的收入一般多少… · 2026/9/27 21:49:59

基于卷积神经网络(CNN)的电影推荐系统深度学习实战项目案例大数据专业毕业设计
基于卷积神经网络(CNN)的电影推荐系统深度学习实战项目案例大数据专业毕业设计

✅源码获取: 🍅--------------------【点击左上方头像,在置顶文章上方的wx】联系我们-----------------🍅 ✌网站介绍:✌10年项目辅导经验、专注于计算机技术领域学生项目实战辅导。 ✌服务范围:大数据、机… · 2026/9/27 21:49:59

归一化LC低通滤波器设计与Ltspice仿真(1)--定K型和m推演型
归一化LC低通滤波器设计与Ltspice仿真(1)--定K型和m推演型

一. 本节简介定K型和m推演型为滤波器设计的古典设计法,目前已经很少使用,本节主要介绍基础概念和设计思路以及对应的仿真二. 实验平台1. 硬件① 电脑2. 软件① Ltspice(Version x64:26.0.2)三. 版权声明1. 作者:LLLor 2. 喝水不忘挖井人,转载请注明出处四. 基础知识1. LC低通滤… · 2026/9/27 21:49:53

AI Agent 的“写权限”之问:TaoToken 统一 Key 下,敢开还是不敢开?
AI Agent 的“写权限”之问:TaoToken 统一 Key 下,敢开还是不敢开?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 21:49:53

一个 40 字节的头如何统一各 ZK-Rollup 的 Poseidon 参数:EIP-5988 预编译深度拆解
一个 40 字节的头如何统一各 ZK-Rollup 的 Poseidon 参数:EIP-5988 预编译深度拆解

一个 40 字节的头如何统一各 ZK-Rollup 的 Poseidon 参数:EIP-5988 预编译深度拆解 【免费下载链接】EIPs The Ethereum Improvement Proposal repository 项目地址: https://gitcode.com/GitHub_Trending/ei/EIPs ZK-Rollup 的电路里普遍使用 Poseidon 这类… · 2026/9/27 21:49:53

【Redis】初识 Redis
【Redis】初识 Redis

目录 1、Redis 是什么 2、对比 MySQL 3、单机架构与分布式架构 3.1 引入分布式架构 3.2 引入负载均衡 3.3 数据库读写分离 3.4 引入缓存服务器 3.5 数据库分库分表 3.6 引入微服务 4、Redis 的一些特性 4.1 基于内存 高性能 4.2 可编程性 4.3 可扩展性 4.4 持久化… · 2026/9/27 21:49:53

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码