听不见的人,怎么玩 FPS 吃鸡?
一台 ¥689 的“AI 脚步声增强”硬件,和一个让听障玩家“看见”声音的开源软件。我做电子信息出身,平时爱拆产品,把官方资料啃了一遍,又用数字电路的常识推了推。发现它俩解的是同一道题,答案比想象中朴素得多。
昨天看吃鸡端游比赛,PUBG 司马杯:
主播在直播间打着“全网最低价”的旗号卖 FOSI 猎鹰声卡(京东原价 ¥699),结果工作人员手一抖,价格没对上。
大司马二话不说,把已下单的单子全额免单。
节目效果,直接拉满。


这一下勾起了我的好奇心:
这个游戏声卡到底是什么来头,能卖到接近七百块?

官网(Fosi Audio C3 Gaming Sound Card & DAC/Amp)上有段官方演示视频,拿的就是同一段音频的原始版和增强版对比。建议戴上耳机,自己听一遍差别:
两段都是官方原始 wav,没有我自己二次处理过,比合成一条对比视频更靠谱,也不用担心转码丢声道。想 A/B 对比,直接点开两条链接来回切换听就行。
先说结论
Fosi Audio C3 的硬件底子摆在明面上:XMOS XU316 + CS43131 + TPA6120×2。一颗音频专用主控,外面挂着发烧级的 DAC 和双功放,干活的是一条实时信号处理流水线——检测、动态增益、压缩。
但“StepSense™ AI 模型”这半句,我得纠正自己一开始的判断。
它不是套壳的营销话术。 有主播从官方拿到的 PR 物料显示,这背后是训练过的神经网络:encoder-decoder 加 GRU。只不过用的是专为端侧设备裁剪过的轻量架构,不是那种只能堆在云端显卡上跑的大模型。
而那个让听障玩家玩 FPS 的开源软件 DeafAlsoPlayFps(聋子也能玩 FPS),走的是完全同一条思路,只是换了个出口:既然左右声道的能量差,是耳机里唯一稳定可靠的信号,那就把这个差值直接画出来,变成屏幕上的一根红绿条。

硬件让你听得更清,软件让你看得见。
音频可视化,殊途同归。
七百块,装了什么
先看官方公开的物料清单:
| 器件 | 型号 | 干什么的 |
|---|---|---|
| 主芯片 | XMOS XU316(xcore.ai) | USB 音频 + HID 控制 + 实时 DSP |
| DAC | Cirrus Logic CS43131 | 32-bit/384kHz 解码,DSD256,9 种重建滤波器 |
| 耳放 | TI TPA6120A2 ×2 | 高电流分立耳放,驱动 16–300Ω |
官方产品页也大方地把这四颗芯片拍了特写,左边两颗是 TI TPA6120,右下角是 XMOS XU316,右上角是 Cirrus Logic CS43131:

如果把专业名词都拿掉,大概可以这么理解:
XMOS XU316 是这台机器的大脑,电脑把声音数据传过来,它实时算好该怎么处理,不用联网、不用等云端,几毫秒内就出结果。CS43131 是翻译官,把处理好的数字信号转换成耳机真正能听到的模拟声音,解码精度是发烧级的,在专业音响圈很吃得开——拿 DAC 芯片的常见分层来说,入门方案够用就好,旗舰独立解码器又贵又占地方,CS43131 卡在中间,集成度高、成本可控,解码素质却够得着发烧门槛。两颗 TPA6120A2 是力气,负责把 DAC 出来的信号推响。
现在很多设备图省事,功放和解码挤在一颗芯片里搞定,一颗顶多用。但这类“全能芯片”电流有限,遇上 250、300 欧的高阻抗耳机容易推不动,声音发闷发软。
C3 为什么要多花钱、多占板子面积,专门放两颗独立耳放芯片?
专职的人,干专职的活。这两颗芯片能给出更大电流、更低失真,不管耳机阻抗高低都推得饱满,左右声道各配一颗,互不干扰。这也是不少发烧级设备的标配思路,不是营销噱头。
这套组合讲了一个清楚的故事:它首先是一台合格的 HiFi 小尾巴,解码加功放,其次才加了游戏增强。CS43131 加双 TPA6120,是发烧友一看就点头的模拟链路,这也是为什么它敢标 32-bit/384kHz 和 DSD256,¥689 也就不算贵了。你买的不是一个“游戏外设”,是“游戏外设 + 入门 HiFi DAC”。
参数表能对上:

耳机输出功率 L+R ≥ 320mW+320mW(32Ω 下 THD+N<1%),信噪比 123–124dB,THD+N 低至 0.0004%,频响 20Hz–20kHz(±0.06dB)。这几个数字放进百元级设备里看,已经不算差,跟不少独立 HiFi 解码器一个水平。
那为什么选 XMOS,不用更常见的 ARM?
这是我盯着产品页琢磨了半天、又用数字电路常识推出来的判断,顺带说说这两颗芯片的江湖地位,挺有意思。
ARM 是电子圈的“六边形战士”:生态最大、选型最多、便宜好用,手机、路由器、智能音箱,哪儿都有它的身影。但它的强项是通用控制,不是“零抖动实时流”。要跑音频这种对时序卡得极死的活儿,得外挂一颗专门的 USB 音频芯片,再靠 RTOS(实时操作系统)硬调优先级,才能勉强达标——多绕一道弯,就多一分不确定性。
XMOS 走的是另一条路:专精选手,天生就是为“实时数据流 + 低延迟”这类场景生的。圈内不少专业声卡、录音接口背后,都藏着一颗 XMOS。它的底气是 xCORE 架构——多个逻辑核各干各的、互不抢时间片,USB 音频协议直接焊在硬件里,不用靠软件模拟,这就是为什么它天生没有中断抖动。
这个选型不是炫技,是用最短的路径,把“USB 声卡 + 游戏声音增强”塞进一颗芯片里。
成熟的工程团队,往往会做这种选择。
“AI 脚步增强”,这次是真的
C3 的核心卖点叫 StepSense**™**,右上角那个“TM”是商标标识,一是打差异化,二是强认知,跟技术含量没关系。
官方文案写得挺玄乎:“AI 模型 + 个性化调音,实时识别脚步声与战斗声,动态强化关键信息……不是调 EQ,而是帮你判断哪个声音更重要。”
一台 689 元的小盒子,真装得下我们理解的那种“AI 模型”吗?
我最初的判断是“不太可能”。理由也很直接:把功能页拆开看,设备对外暴露的就那么几样——StepSense 开关、四款游戏选择(CS2/PUBG/三角洲/无畏契约)、增益等级、爆音抑制、个性化 PEQ。没有任何迹象表明用户或主机端要下发什么“模型参数”,所有的“智能”都在设备内部闭环完成。我一度觉得,这大概率是套了个 AI 名头的实时 DSP。
但这个判断得改。有主播拿到的官方 PR 物料里,有一页明明白白写着“In-House FPS AI Model”:

这是一张真正的神经网络架构图:encoder-decoder 结构,中间接了个 GRU,两端各堆了好几层 depthwise separable dilated convolution。旁边配的训练数据更实在:CS2 训了 3950 小时、208 万条样本;PUBG 4000 小时、217 万条;三角洲 4483 小时、238 万条。每款游戏都是单独训一遍,不是拿一个通用模型糊弄所有游戏。
说人话:encoder-decoder 说白了就是先压缩、再还原,把声音里的关键信息提炼成一小撮特征,再重新组装成“这里该不该被强调”的判断。GRU 专门处理有先后顺序的数据,声音正好是一帧接一帧的序列,适合用来记住刚才发生了什么,现在该怎么判断。depthwise separable convolution 这个词最值钱的地方不在“卷积”,在“depthwise separable”——这是手机端 AI(比如 MobileNet)压缩模型体积、降低算力消耗最常用的招数。
这套网络从设计那天起,目标就是塞进小设备里跑起来,不是那种只能堆在云端显卡上跑的大模型。
所以更准确的说法是:StepSense 背后确实是训练过的深度神经网络,而且是专门为端侧实时推理裁剪过的轻量版本,不是我最初以为的“AI 只是营销话术”。这次我猜错了,得认。
诚实说一句:这张架构图和训练数据来自主播拿到的官方 PR 物料,不是我自己拆机验证的。它大概率是真的,官方物料造假的成本和风险都不低。但我没法 100% 确认这套网络就原封不动跑在 ¥689 这颗 XMOS 芯片里——更可能的情况是训练在服务器上完成,端侧跑的是量化、裁剪过的精简版本,好把算力压进这颗音频 DSP 芯片的预算里。这一点,只有拆机做黑盒测试才能彻底坐实。
不管网络内部具体怎么算,最终落地到信号上,大致是这么几步:
| 技术图(信号真实发生了什么) | 大白话图(说人话) |
|---|---|
![]() | ![]() |
![]() | ![]() |
![]() | ![]() |
(DSP 课程还在发力)
网络“猜”的不是脚步声本身,是“这一帧像不像脚步声”这个概率。像,就抬一抬。不像,就放过。
这跟人耳分辨脚步声的方式其实很像。我们也不是靠某种玄学直觉,而是靠经验里攒下的声音特征在做判断。
打枪、爆炸的声音,瞬间能冲到很高的分贝,尤其戴着耳机,这种突然的巨响很伤耳朵,也容易把人吓一跳。
如果简单粗暴地把整体音量调低,脚步声这些该听清的细节又会跟着一起被压没。
那怎么才能既压住枪声爆音,又不伤脚步声?
答案是 DRC,动态范围压缩。不是一刀切调音量,而是专挑“太响”的部分往下压,安静的部分原样保留。手机的“夜间音量均衡”、剪视频常用的“响度压缩”,用的都是同一套原理,C3 只是把它用在了枪声爆炸上。
诚实说一句:这段是基于官方功能描述和实时音频工程常识推演出来的,不是拆机实测。要 100% 坐实,得拿真机做黑盒测试,注入已知信号,测输出差异。但目前看,这个推演和官方所有功能描述都能对得上。
官方还有个细节值得一提:支持的游戏是一个个逐步开放的,而且会随固件更新增加。从公开的版本更新记录看,新增一款游戏(比如无畏契约)就是单独一次更新。
这一点前面那张训练数据表已经给了实锤:CS2、PUBG、三角洲的训练时长和样本量都不一样,每款游戏就是单独训一遍,做完一款就通过更新点亮一款。
这个产品设计挺聪明,后面讲生意经时还会再提。
看得见的声音
有意思的是,我还发现一个开源项目 DeafAlsoPlayFps,一个 Windows 软件,干的事和 C3 正好互补。
它的目标人群是听障或弱听玩家。
要解决的问题很直接:你听不见脚步声没关系,我把脚步声来自左边还是右边,用屏幕上一根红绿条告诉你。红色条在左,声源在左,该往左转。绿色条在右,声源在右。
技术上,它干了一件特别诚实的事:不读游戏内存,不注入进程,不碰耳机输出,只是用 Windows 的 WASAPI loopback(系统音频回环),把“最终要播给耳朵的声音”抄一份出来,算左右声道的能量差。
这里还有个技术选择值得一提:更专业的路子是走 ASIO,延迟更低,但要装驱动、抢独占,普通玩家未必愿意折腾。WASAPI loopback 不用装任何驱动,打开就能用,延迟稍高一点,换来的是“人人可用”。对一个开源工具来说,这笔账划算。
核心代码就那么几行:
// WASAPI 回环 → 左右 RMS → dB 差
leftSumSquares += leftSample * leftSample;
rightSumSquares += rightSample * rightSample;
// 然后用 20*log10(right/left) 算 dB 差,驱动红绿条
为什么是这个算法?因为游戏音频经过引擎、Windows 声卡、HRTF 虚拟化混音之后,到耳机时只剩左右两路,唯一稳定的信息就是左右能量差。前后、上下方向,在双声道里几乎抓不住可靠特征,所以它干脆不装,方向圆环只当个弱提示,真正押注的是左右转向条。
这个判断很专业。20·log10(R/L) 用 dB 而不是线性差,是因为人耳对响度差的感知本来就是对数的。短促脚步声再加 150ms 视觉保持,是因为脚步一闪而过,来不及反应条就没了。这些参数,都是踩过坑才能调出来的。
而最妙的是,如果有人问我“能不能用软件复刻 C3 的脚步增强”,我作为工程师第一反应就是这条路:WASAPI 回环、声道差分析、动态增益。这个软件已经把路走通了一半,只不过它输出的是视觉,不是更响的声音。
硬件和软件,其实是一条路
把两个东西摆一起,对比就清楚了:
| 维度 | C3(硬件) | DeafAlsoPlayFps(软件) |
|---|---|---|
| 解决什么 | 让声音更清晰可辨 | 让声音变成可见的转向提示 |
| 延迟 | <10ms(全片内 DSP) | ~30–60ms(loopback 缓冲) |
| 反作弊风险 | 零(纯声卡) | 零(只读 Audio API,不注入) |
| 跨平台 | 即插即用(PC/PS5/主机) | 仅 Windows |
| 能力上限 | 增强 + DRC,但识别是黑盒 | 只能左右定位,前后做不准 |
| 成本 | ¥689 + 一台机器 | 免费,开源 |
两个东西其实互补,不是竞争。
C3 解决“听得清”,软件解决“看不见的人怎么办”。
甚至可以叠加用:先用 C3 把脚步声增强,再让软件把增强后的声音可视化,对弱听玩家可能是双倍友好。
真正的对手不是彼此,是免费软件逼近的速度。 DeafAlsoPlayFps 已经证明,WASAPI 回环这条路走得通。往后再加一个轻量分类器,把“左右定位”升级成“脚步/枪声/换弹”分类,就能逼近 C3 的核心体验,而且零硬件成本。C3 能守住的,只有延迟、跨主机即插即用,和那套按游戏持续迭代的调音 know-how。
如果做成一门生意
说完技术,换个身份,如果我是想入局的创业者,这笔账我会这么算。
先算成本。把 Fosi C3 官方公布的物料,代进公开的元器件行情:
- XMOS XU316 约 ¥40–50
- CS43131 约 ¥20-30
- 两颗 TPA6120 约 ¥26–36
- 再加上光纤/同轴/RCA 这些多接口、外壳、贴装
出厂成本(COGS,说人话就是造一台设备的物料加生产费用,不含研发、营销、渠道)大概落在 ¥160–210。
零售 ¥689,扣掉电商佣金和经销环节,厂商净出厂收入约 ¥400。算下来:
- 单台毛利约 ¥190–240,毛利率约 48–60%
- 一次性研发投入(固件、算法、硬件、Web App)大概 ¥6–10M
- 中位假设下,卖到 2.6 万台、约 7–9 个月回本
这个毛利率放进消费电子大盘子里看,已经算相当健康,一般 3C 配件类产品毛利率多在 30–40% 徘徊,能摸到甚至冲过 50%,说明它不少靠“卖 HiFi 溢价”,不是纯靠硬件堆料。更别提 Fosi 主打的是海外市场……
这是一门前期重、后期轻的生意。COGS 低、没有电池(省仓储物流),模拟链路还能吃下 HiFi 受众(不只游戏圈)。回本的关键变量是月销斜率,不是成本。
但真正让我佩服的,是它的运营节奏。从公开的版本更新记录看,这款产品大概两三周迭代一次,新游戏支持是按版本节奏一款一款放出来的。每加一款游戏,就是一次零边际成本的“免费 DLC”,唤醒老用户,拉新,顺带维持口碑。
这是把硬件当 SaaS 在运营啊。硬件一次流片,软件持续造血。
这种打法,对任何想做消费电子的创业者都是一堂免费课:别只算 BOM,要算 LTV(用户生命周期价值);别只拼首发,要拼持续运营。
值不值,该不该抄
如果你是发烧友兼竞技玩家,C3 值。模拟链路(CS43131 + 双 TPA6120)对得起这个价,游戏增强算锦上添花。
如果你只是想要“听声辨位”的能力,又只用 PC,先试试 DeafAlsoPlayFps 这类软件。免费,方向也对。
至于“能不能软件复刻 C3”——EQ、DRC、空间音频,免费软件就能做出八九成;真正难的是那套按游戏特化、持续训练的检测模型。一款游戏就要几千小时、两百多万条样本喂出来,这个门槛不低。短期内软件追不上,但 3–5 年后,中端硬件会被慢慢蚕食。C3 要守住护城河,得把“跨主机、低延迟、模型持续迭代”这几件事挖得更深。
推开一条缝
最后说一句和钱无关的。
我最喜欢这个开源项目的地方,是它的名字,Deaf Also Play FPS,听障的人,也能玩 FPS。
技术圈天天吵“AI 颠覆”“芯片战争”。但真正打动人的,往往是最朴素的方法:抄一份音频,算个左右差,画根条。把一扇原本对某群人关着的门,推开一条缝。
C3 让听得见的人,听得更准。这个软件让听不见的人,也能玩。
都挺好。
本文基于 C3 官方产品页与规格说明、公开的版本更新记录、公开的官方 PR 物料,以及
DeafAlsoPlayFps开源项目代码分析写成。技术判断是基于数字电路与实时音频工程常识的推演,商业数字是基于公开元器件行情的估算,不构成任何投资建议





