Echo's blog
Echo's blog
· 1 min read · 资讯

把代码转成图片喂给AI,反而省了60%的钱

AI 吃 Token,pxpipe 说:那你改吃图片#

AI 吃 Token,pxpipe 说:那你改吃图片

你有没有想过一个画面——你把一段几百行代码截成截图,发给了 ChatGPT,然后你的账单变便宜了?

听起来像反逻辑。图片那么大,Token 不得爆炸?

不,pxpipe 告诉你:恰恰相反。一个叫 teamchong 的开发者在 GitHub 上丢出了一个项目,目前 135 颗星,名字叫 pxpipe。它做的事很简单:一个本地代理,在请求离开你电脑之前,把对话里那些”又大又没用”的部分——比如历史记录、系统提示词、工具输出——渲染成紧凑的 PNG 图片,再喂给 Claude Code。

结果?Token 消耗直接砍掉 60%。

为什么一张图比一段文字更省 Token#

为什么一张图比一段文字更省 Token

这里藏着一个很少人认真想过的数学事实。

AI 模型看图片,Token 成本是由图片的像素尺寸决定的,跟图片里塞了多少字完全没关系。一张 800×600 的截图,管你上面是 10 个字还是 1000 个字,花的 Token 是一样的。

而文本呢?一个字就是一个 Token 的节奏。JSON、代码、终端日志——这些密集内容差不多是每字符一 Token。

pxpipe 的测算结果是:在图片模式下,每图片-Token 可以承载约 3.1 个字符;文本模式下这个数字只有 1。差距将近 3 倍。更极端的情况更离谱——一份约 2.5 万 Token 的文本对话历史,渲染成图片后只剩 2700 Token。接近 10 倍的压缩比

不是压缩算法多厉害,是 AI 的视觉 Tokenizer 和文本 Tokenizer 在定价上存在一个巨大的”套利空间”。pxpipe 不过是把这个套利自动化了。

本地代理,悄无声息地偷懒#

本地代理,悄无声息地偷懒

技术实现并不花哨。pxpipe 跑在你本地,作为一个中间人,拦截发往 Claude Code 的请求。它用启发式规则判断哪些内容属于”高密度、低信息熵”的区块——典型的比如屎山代码、长长的 JSON 响应、重复的系统指令——然后把这些东西渲染成 PNG,替换掉原始文本。

整个过程对用户透明。你发现自己该写的代码照样写,该问的问题照样问,但月底看一眼账单——少了六成。

当然,这个思路不是银弹。对话里那些本身就很短的文本(“对”、“继续”、“好”)不值得转图片;图片 Token 也有一个固定基础开销。但只要你对话历史够长、代码片段够多,pxpipe 几乎是稳赚不赔的。

有意思的是,这个项目本质上是在利用 AI 模型自身”视觉贵、文本便宜”的定价不对称——但它偏偏把贵的部分变得更便宜了。你说这算不算一种逆向套利?

来源:GitHub | Hacker News

Related Posts

Comments

Copied
Copied to clipboard