善意提醒

如果您打开本站很慢,布局排版混乱,并且看不到图片,那么可能是因为您还没有掌握用科学的方法上网的本领。
显示标签为“AI”的博文。显示所有博文
显示标签为“AI”的博文。显示所有博文

2026-07-31

四十年的心愿

大约五六岁的时候,我姑姑带我去过一次街机游戏厅,在解放碑那边。后来年纪大一些以后,我故地重游,结果在那边被抢劫了一次。但当时还小,没有这些龌龊事情。

一块钱买了三个游戏币。第一个给了《空手道》,这是当时游戏机上写的名字,但并不是后来上了 FC 那个。小小年纪的我并不会玩,因此没多久就结束了。一开始有演武的环节,然后是对战。我记得我只会缩在左边挨打。最后的 Game Over 画面是主角背了个包被扫地出门,我对这个还印象深刻。

人气比较高的是《小飞侠》,当时不知道游戏名字,只知道是拆炸弹。那些是炸弹?我一开始还以为是气球。所以怎么挂的都不知道。气球怎么会爆来着?不碰不就不会爆吗?

还有的人在玩《机器人变飞机》,以及《忍者》。后面这三个游戏后来都移植到了 FC 上,所以我并不陌生。然而还有一个游戏我始终没能找到。

那是一个关于海战的游戏。玩家控制一艘船,俯视视角,有两个瞄准镜,貌似是高炮以及对海火力。玩家可以开火,也能控制船的移动。游戏中有成群的敌机来袭,击坠后飞机会着火,划一圈坠落在海上,还会产生水柱。敌人的飞机也会投弹,并且也有海军舰船来袭,好像也会发射导弹。一开始军舰是航行在宽阔的海面上,后来会经过一段狭窄的河道,河道两旁有探照灯。

当时机台上有一个水平很高的人,一直霸机在玩,所以我才看到了这些本属后期的场景。他的分数甚至高到奖了命,仿佛能一直玩下去。围观的人很多,我担心下一个轮不到我,于是偷偷地把拿游戏币的手贴在了投币口,结果一不小心游戏币就滚了进去。

手足无措的我开始大哭,惊动了姑姑,以及游戏厅的老板。姑姑比老爹年轻十岁,所以当年其实也就是个小姑娘而已,好在还有男朋友。最后协商的结果,就是那个高手只好很无奈地草草结束。可想而知,我也很快就 Game Over。围观的大家都不欢而散。这件事在我心中形成了一个疙瘩,仅次于那次抢劫。

不过我还有一个疙瘩,就是直到现在我都不知道这个游戏的名字。尽管有了各种街机模拟器,但街机游戏浩瀚如烟海,我不可能一个个去看过。Google 出不来什么像样的结果,关键是我都不知道从何查起。去问游戏达人,但纵使见多识广者也不知道我在说什么。因此我甚至都没法重温一下这个游戏。

还好现在有了 AI。我把情况尽可能详细地描述给 Google Gemini。第一次没开「扩展思考」模式,出来的结果不对,甚至有幻觉。第二次我开了「扩展思考」模式,它想了半天输出的结果,第一条就是:《D-Day》(Jaleco,1984年)

四十年以来的心愿,已经差不多了结了。不过还有一个问题:不论是《小飞侠》、《忍者》还是《D-Day》,在我印象中的画面都要好很多。打斗激烈很多,操作也要流畅很多。而我现在看到的像个雅达利游戏。

AI 说这是因为我心中有「滤镜」的缘故。许多男人心中的初恋也都是美好的,大抵也是这个因素。
我是无法确认这件事情了。时光无法倒转,当年也没有手机可以拍影片。既然记忆更美好,那就让它一直美好下去吧。

毕竟,以前我是真的可以直接访问 Google 呢。

2026-04-08

当 AI 遇上忒修斯之船

在软件中需要加入一些为用户个性化定制的内容推送,因此需要一个用户标识。

正常情况下,如果用户有登录,就是一个 UserID 的事情。然而我们这次的场景是匿名使用,所以没有这个 UserID 可以用,需要自己来生成一个。

以及,产品设计上希望能做到还是能大致识别到一个「人」。同一台机器上如果有多个我们的软件,最好能得到相同的 ID。因此最后商量下来决定采用设备 ID(或设备指纹)的方式。

如果是 Web 浏览器,算是有相对成熟的方案。浏览器指纹也不是一两个人在做了,「广告」这个需求天然就需要这种东西。然而我们是 MFC 程序,需要自己想办法。

我以前做 Shareware 的时候也大致接触过一些 DeviceID 的东西,知道这种事情吃力不讨好。很难覆盖那么多种类的硬件,特别有一些可能还是服务器上才能见到的东西。万一搞不好,说不定在某些特殊硬件上还要出什么状况,所以并不是一件容易的事情。所幸我们这次的事情并不是性命攸关的「注册码」,只是一个可有可无的身份标识,即使拿不到,也可以接受,因此压力没那么大。

很自然地,我想到了让 AI 来做这个事情。说到「见多识广」,可能没有人比得上它。知识结构也是它比较新,不用担心去网上找到的开源代码只能支持老旧硬件的事情。把需求描述给了它,很快就生成了一个函数,专门用来在 Windows 上得到 DeviceID。

自测的时候,问题来了:DeviceID 有时候会变。
其实这个问题一早就埋下了,是我需求没向AI说清楚,算我的锅。

说起来,这类需求虽然都可以描述为 DeviceID,但实际上是不同的:

  1. 用于区分两台设备;
  2. 用于追踪使用者。

两者是有大区别的。前一种就最好是有点变化就换个 ID,后一种则应该只要怀疑可能还是原来那台,那 ID 就不要动。

但是,这种事情确实不太好把握。加根内存条算不算新设备?可能不应该算。那换块硬盘呢?如果 CPU 升了个级,心脏都变了,还说没变化,有点说不过去吧?以及,如果用户把操作系统从正版的 Win10 家庭版给重装成了盗版 Win11 专业版呢?

图片由 Google Gemini 3 Pro + Nano Banana Pro 生成

我们的需求肯定是希望尽可能不要因为一丁点儿变化就换一个 DeviceID。但这事是一个「忒修斯之船」悖论。变到什么程度才算一台新设备?如果太过追求某一个极端,就会落入两头的陷阱。要确保 DeviceID 的「排他性」,就需要冒「稳定性」不佳的风险。

AI一开始给出来的方案,「稳定性」是不够好的。即使硬件和 OS 都没有发生变化,它也可能会变。据说是多核 CPU 的线程绑定带来的问题。麻烦在于,如果我不从需求侧来反推,以及没有进行足够数量的测试,很可能发现不了。

解决了这个问题,还有另外一个问题:如何保证这段用于生成 DeviceID 的代码,在各种硬件上都能稳定运行?

我们的要求很低:如果不能保证生成 DeviceID,那就别生成,或者生成一个可能会重复的,都 OK。这算是允许牺牲 DeviceID 的「稳定性」,来换取更好的「鲁棒性」。这个需求我从一开始就给了 AI,它的确也在代码上作了处理,我有看到。然而,如何保证呢?作更多的测试?

我目前能想到的:在调用的时候套一个 try...catch,不知道有没有用。另一个我知道肯定有用的办法,就是把这个事情扔给一个独立的进程来做,这样应该可以保证万无一失。软件运行架构会需要一点调整。我知道这样去做,AI 呢?你如果只是把它限制在写函数这件事情上的话,它肯定没法告诉你答案。

这种事情,让 Claude Code 来做,能更好吗?如果让 OpenClaw 放开手脚不限费用地去干,它最终能搞定吗?GIGO,如果人想偷懒的话,估计就会很难。

2026-01-26

两盆冷水敬 AI

我要给 AI 泼两盆冷水。

图片由 Google Gemini 3 Pro + Nano Banana Pro 生成

第一盆是泼给 Vibe Coding 的。

很多鼓吹这个的文章,都认为它将导致大量的 Software Engineer 失业。更有甚者觉得整个软件行业被会颠覆,因为人人都能写代码。

是不是这样,我目前还不想去讨论,毕竟世界一日千里。然而,跟大家说一个常识:「AI 就是世界所有知识的平均数」。

你现在觉得 AI 比你强,那是因为在你问的那些方面,你的知识水平还没到及格线。AI 厉害的地方在于它能低成本地快速补全你欠缺的东西。但是如果你是某个方面的专家,你就会发现 AI 还是离你有一段距离。在真正的专家那边,这段距离不小。

通过 Vibe Coding 或许能快速获得一个「还能用」的软件。这个软件或许能快速解决用户当前的某个需求。如果这个需求很容易描述的话,这个软件也用起来也挺不错。比如写个「俄罗斯方块」游戏之类。不过一旦需求复杂起来,要描述的难度也就急剧上升,系统内部的复杂度大增,出问题的可能性也随之大增。众所周知,软件开发最麻烦的地方,其实是「八二原则」里面那些 80% 用来解决性能以及鲁棒性问题的代码。如果不在这些地方下足工夫,那这种软件,其实无法「交付」,只能自己用用。

在我看来,AI 其实蛮适合解决这类问题的,因为 AI「不嫌麻烦」。前提是人也要不嫌麻烦,不厌其烦地提要求,从各种角度假设,让 AI 检查再检查。如果能有这种意识,已经是一个超出平均水准相当多的「产品」兼「测试」人员了。如果说要被淘汰的 Software Engineer 就是这类既不具备产品意识也缺乏质量意识的人,那我只能说句「活该」。但话说回来,既然是如此的人才,计算机语言真的那么难学,非得绕着走吗?

总之,普通人的不可能三角——高质量、低门槛、易获得——在这里依然起作用。AI 确实缩短了三角形的边长,让平庸的代码产出变得廉价,但它并没有改变三角形的定律:真正的顶级质量,永远不可能通过「一键生成」这种低门槛的方式获得。

第二盆要泼给 AI 写作。

周末看了一些号称完全由AI生成的文章。用到了多个 Agent,互相协作,的确蔚为壮观。
然而,看了以后,给我的感觉就是:没有灵魂。

AI 讲逻辑是很厉害的,说起话来头头是道。我认为,一些科普、分析、说明性质的文章,换句话说,议论文和应用文,是行家里手。略加提示与输入,文笔也不是好不起来,模仿一些文学大家或许都绰绰有余。

但是,它不能给我新的东西。

我不太知道如何形容这种所谓「新的东西」。AI 写的文章,肯定有让我眼前一亮的部分。但是,我想看到的,来自人类自身的体验和感悟,一些鲜活的事例,个人的见闻,没有。如果有,那也是人喂进去的,不算 AI 自己的东西。

我也知道,AI 目前还只能加工,无法去「采风」。这不算它的错,只是它目前的局限之所在。我很期待有一天,它能够有自己的东西,但至少目前还没有。

所以,目前我只能看着这些一篇篇滴水不漏的文章,完全没有阅读的欲望。或许我喜欢的不是这类文章吧,我可能更喜欢随笔一些。「讲道理」没关系,但更要有故事。

我想起了《奇点天空》里面的「节日」,近乎贪婪地索求「故事」,不惜以「丰饶之角」来交换。或许,这就是人类存在的意义吧。

2026-01-15

逻辑的奴隶?这次我把 AI 领进了死胡同

最近有同事问我:为什么公司旧版软件在执行某个特定操作时,屏幕上的一部分 UI 就不动了?

说实话,这套旧代码现在成了公司里的「考古遗迹」。唯一深谙此道的同事已经财务自由,移民香港了。我对这个细节也并不非常清楚,只能去看代码。相关代码错综复杂,看得我眼花缭乱却毫无头绪。

想到最近 Google Gemini 3 Pro 的强劲表现,我索性把代码全扔给了它,开启 Pro 模式进行深度分析。

为了「提高效率」,我在 Prompt 中加入了自己的判断:「我认为是相关的 Windows 消息被过滤了。」在我看来,这再自然不过——既然界面停下了,那逻辑上一定是忽略了导致绘图的消息。我只是找不到过滤逻辑的标志位而已,而这事正适合让 AI 靠「蛮力」深挖。

从逻辑上讲,AI 显然非常「同意」我的判断。它一头扎进了我给出的代码里面,然后得出了一些似是而非的结论。我核对后发现,有些结论可以直接排除,有些则根本不符合事实。这意味着,顺着我的思路走下去,连 AI 也找不到真正的原因。

对话进入了死胡同。而 AI 在这种情况下似乎不知道「退出来」,只是机械地一次又一次给出「可能是……原因」的无效推测。最后我不得不靠调试来自行解决问题。

真正的原因,是那位同事在软件界面上遮挡了一个不进行重绘的透明窗口。

图片由 Google Gemini 3 Pro + Nano Banana Pro 生成

事后复盘:我在这里犯了一个典型的错误——我不该在一开始就说出我目前为止的判断。

我反思,如果当初少说一点,让它自行研究,结果会不会更好?我们一贯以来对于 AI 的使用方法,基本上都是「让它知道得越多越好」。我甚至曾这样建议别人:『别隐瞒,把你知道的东西事无巨细都告诉它,哪怕你认为没用的也要告诉它。』

这个原则本身没错,但前提是:你告诉它的是「事实」,而不是「错误的观点」。

很多人类尚且无法区分「事实」与「观点」,AI 可能就更不知道了。在我看来,我的提问还有改进的空间:

  1. 明确标注信息属性: 在 Prompt 中清晰指出哪些是明确的事实,哪些是模糊的现状,哪些仅代表个人的观点和推测。
  2. 允许 AI 「退后一步」: 对于 AI 而言,这只是在做题。Prompt 越具体,求解范围就越窄。我们不能只是把 AI 领到迷宫门口,然后让它进行探索,却不允许它「爬墙头」。

人类会犯错,然后学到东西。AI 也会。如果 AI 能「对抗」人类的意志,我不知道这是好还是坏?

总之,共同进步吧。

2025-12-24

订阅了Google AI Pro

看过一些朋友的推荐,也跟 Google Gemini 一番探讨之后,今天终于下决心订阅了 Google AI Pro。

可以有更多的 Google Gemini 配额了,包括「思考」和「Pro」,后者貌似就最近两天才加上的。以及,更多的 Nano Banana / Nano Banana Pro 图片配额。还可以用 Veo3.1 做视频。免费版的 Deep Research 配额我曾经用满过,所以还真是有必要成为付费用户。

Google 全家桶里面也可以用 Gemini 了。我记得有印象在 Gmail 里面看到过 Gemini 的图标,但今天去找的确找不到了。莫非是当时 Google 放的鱼饵?

另外,对我而言还有一个挺有吸引力的福利:2TB 存储空间。太太的 Google Photos 空间早就满过了,删了一些视频才降下来。我自己也不敢拍太多照片和视频,就怕哪天空间满了出事情。这问题甚至影响到了我的某些旅游的体验,现在不成问题了。

详细介绍见这里,不过我不知道算不算是最新的:https://support.google.com/gemini/answer/16275805

我是选的「包年」方式,因为感觉一旦用上了应该就「回不去了」。
首年 $100,之后每年 $200。包月正常价是 $20,现在也有试用优惠。不知道是不是年底或圣诞节特别搞的活动。反正都要买,不想等几天错过了,就下单了。
我个人是不太在意这些小恩小惠的,何况已经很划算了。

说起来,Google AI Pro 应该是普通中国人最容易「够到」的顶级 AI 品牌的付费服务了。ChatGPT Plus 之前对中国用户想尽办法封锁,还砍单封号来着。直到现在也没见得有多方便,甚至连「安全」都不一定算得上。我曾经形容为「被中美混合双打」,为了用个靠谱的AI也真是难为了。

图片由 Google Gemini 3 Pro + Nano Banana Pro 生成

当然,对于普通人,我一律是劝他们尽量多用 AI,哪怕是国产 AI。
有在用总比没有在用要强。面对熊,你只需要比同伴跑得快就行。

AI 问:那如果是面对狼群呢?

我说:你差不多得了。 

2025-08-31

AI 很不错,但人类不行

 图片由 Google Gemini 生成

AI 的用途里面,很不错的一个就是用来自学。对于有积极性,有自我驱动能力的人而言,它是一个非常好的老师。由于它已经学习并掌握了人类几乎所有知识的至少平均水准的内容,所以很适合用来快速地让自己进入一个从未涉足过的领域。在刚开始的时候,通过与它的几轮对话,就会有巨大的收获。相比起在线课程,以及自己查资料而言,知识的深度和广度都更为甚之,针对性还很强。这种问答式学习,效率非常高,效果也非常好。

然而,这个优势只对于「知道自己要问什么」的人有效。如果你都不知道自己要问什么,那么 AI 也不知道要告诉你什么。换句话说,起码你得对与自己的「无知」有一个基本的了解,然后才能通过这种方式进行提高。如果你认为自己都知道,就不会去提出问题,那 AI 也不可能帮到你。

虽然也可以通过问 AI「如果我要学习某方面的知识,应该如何开始」来获得一个 Startup。但这样的话一开始给出的信息密度太低,后续能结出的果实恐怕也很有限,最后可能还没法带你达到「平均水准」的高度。当然,对于很多专业性很强的领域,即使这样入个门也很 OK 了。不管会不会用 AI,用的水平有多高,有得用都比没得用、不用要强,强不少。这也是我的一贯态度。

我最近也有点受困于这个问题。我总是在走路、坐车或发呆的时候,想起不少想要细细了解的事情,然而一但离开这个状态,很快就会把它们给忘了。等我可以坐在电脑前好好组织自己的问题的时候,怎么也想不起来要问什么。大概上了年纪,接下来可能不得不求助于一些笔记 App 了。每当这个时候,我就想找 John Scalzi 要一个「脑伴」。

其实 ChatGPT 的语音问询功能也已经很不错,Google Gemini 也有类似能力。但我还不太习惯用,毕竟让周围的人听到你的问题,很多时候都有点尴尬。语音录入的「痛点」就在于隐私。或许我还是应该行动力更强一些,想到什么就动起来,这样就没有这些问题了。


用 AI 来学习,在我看来是它最好最棒的用途。不过有的人可能不是这样想的。

今天我很震惊地得知,儿子兜里有 40 元钞票,居然是他用 AI 赚回来的。

他去小区里面上了一个暑期的补习班。说是补习,其实只是一些大学生照看着做作业。在我看来没啥效果,但也不能让他一天到晚在家里玩腾讯的垃圾「三角洲行动」或看短视频,因此还是送他去了。

据说有一个初三的学生,可能是临近暑期结束了,作业还没做完。有两张英语试卷,花 40 元「雇」了儿子来做。
儿子倒也没含糊,回来用了 ChatGPT 给他做了。我估计是用了拍照上传的模式。如果真的一道题一道题地录入,人家这 40 倒也花得值得了。

这事我今天才刚知道,让我有些哭笑不得。这算利用「信息差」赚钱吗?

儿子这样的做法自然是不可取的,不过事实上应该有很多人也在干着类似的事情。在知道 AI 和不知道 AI 的人之间,会用 AI 和不会用 AI 的人之间,只能用国产 AI 和能用世界顶流 AI 的人之间,都存在着信息差。某种程度上,我也在赚着这样的钱。DeepSick 几次把同事带入了歧途,而 Google Gemini 和 ChatGPT 在工作上都有真真实实帮到过我。

但不管怎么说,这样都比那些用 AI 来做 AV 换头,或者搞视频、语音诈骗的人要强多了。
未来的 Skynet 可能会很郁闷:这么强大的东西,你们人类就用来干这些狗皮倒灶的事情?!

话说回来,可能很多人都会这样想:既然 AI 什么都知道了,有什么事直接问它,以及将来有什么事直接让它去干就好了,我干嘛还要学习呢?
所以说呢,人类,也就到此为止了吧?

2025-08-26

搜索习惯的这些变化感觉不是个好事情

图片来自网络

长期以来,我习惯在搜索引擎上搜东西。主要用 Google,偶尔也会去用 DuckDuckGo。Baidu 那是「取材」的时候才会去用的。

现在很多人喜欢在 SNS 上搜东西了:微信、微博、小红书、抖音……

我拒绝这样的用法。正常人在 SNS 上写的那点碎片,搜出来也没有意义。如果能搜到大段的「有意义」的东西,那就是有人精心准备的喂给别人看的。利益驱动明显,正确性和中立性相当值得怀疑。不再会有 Web 上 Wiki、Document、非商业性官方网站那种出于非利益性目的的分享了。即使有,质量也不高。这样的话,能搜到什么东西,可想而知。

当然,以上论调,仅限于中国大陆的简体中文「互联网」环境。


另外一种变化,就是很多人开始喜欢直接在 AI 上搜东西了,直接问。所以我觉得 Google 搞 Gemini 是必须走的一步,而且时间也不能再晚了。很高兴 Google 勉强算是搭上了车,目前还没被甩下去。

AI 能帮人过滤、汇总和组织信息,所以貌似效率更高。我也很能理解为什么会这样。有时候我急着想要一个答案,特别是想要给别人看的答案时,也会直接问 AI。不过如果时间允许,我还是愿意自己来做这些分析、整理的事情。

每当我选择去做或者不去做这些事情的时候,脑海中浮现出的就是《蠢蛋进化论》里面的各种蒙太奇。


最糟糕的是,有的人开始不搜东西了。

他们只习惯点开某个 App,然后等着被投喂到他面前的东西。在我看来,这比什么都糟糕。这的确让我想起了那栋大楼里面的那些动物。

人类,也就到此为止了吧?

2025-08-18

DeepSick 二三事

图片由 Google Gemini 根据文章内容生成,与本人无关

上周,有同事遇到自己用代码导出的网页内的图片在 Firefox 上显示不出来的问题。他觉得是因为图片是 BMP 的缘故,带着这个问题去问 DeepSick,结果这个 DeepSick 就回答说:是的,Firefox 不支持 BMP 格式的图片。
信以为真的同事,继续往下走的每一步都是错的。

我听说了这事就纳闷。不推荐 BMP 当然是真的,但要说不支持,最原始的位图为啥不支持?去问了 Google Gemini 和 ChatGPT,都说没这个说法。不知道 DeepSick 是从哪里听说的,百度贴吧吗?

当然,一切以事实为准绳。我自己亲自去下载了 Firefox,亲自试了一下,搞清楚了事情的原委。这位同事把 BMP 在网页 img 标签中的 src 写成了绝对路径,而且还是Windows风格的「\」反斜杠,能出来才有鬼了。

他问我为啥 Edge 和 Chrome 可以这样写。我也只能说以前靠 IE,现在靠这两货给惯的。「file:///C:/a.bmp」这种写法他居然完全没听说过,看来还是从前论坛混太少。硬盘贴图党对这个应该是不陌生的。

当然,正确的写法应该是用相对路径。否则用户导出的网页换一个目录存放就看不到图片了。前面加不加「./」都不重要,重要的是不能用绝对路径。这个事情我一提他倒是想起来了,还有救。


DeepSick 在这件事情里面有没有锅?当然有。感觉被调教得过于谄媚,顺着问的人说,完全罔顾事实。拿不准就拿不准吧,还说得斩钉截铁,这就是很大的问题了。
更大的问题当然是人,驾驭不住 AI,必然被带走。然而同事也只是受害者,DeepSick 背后的团队和社会环境,才是更大问题的根源。

我从来不用 DeepSick,有 Google Gemini 和 ChatGPT 可以用,为什么要去找 Sick 呢?不过有朋友两个都在用,也给到我一些反馈。说跟 ChatGPT 相比,DeepSick 就像个智障,明显感觉更「傻」。慢就不说了,输出内容也是不行。可能乍一看还行,但一对比就高下立判。

这方面我没有具体案例,但她的这种感觉显然是对的。ChatGPT 我最近用得也越来越少,因为我想多「培养」一下 Google Gemini,而且 Google Gemini 的 Quota 感觉更多一些,速度也更快一点。但有的时候我还是会两者对比一下,以防被骗。这种时候就会有感觉,以为 Google Gemini 的回答已经足够出色,但 ChatGPT 还能再「更上一层楼」。不由得感叹:AI 比 AI,气死 AI。

不过这些 AI 也有集体犯傻的时候,傻得就很可爱了。


有一次,我让 AI 帮我分析一篇研报,但研报的来源那天偷了懒,直接放了一张图片上去。当时我的代码并没有适配图片,连下载都没有下载下来,更别提什么 OCR 的事情了。可以说我就只是丢了一个标题给 AI,然后让它去分析。

当时用的是阿里的通义千问的 API,做摘要用的是 turbo 版。qwen-turbo 给到我的摘要,洋洋洒洒,像模像样的一大篇,涵盖了四五个品种。如果我不是事先知道会有问题,可能就被骗过了。

我们当时很奇怪,AI 会做梦我们是知道的,但做得这么有内容,有点意外。于是有同事把相同的 prompt 给到了 DeepSick 一试,发现出来的内容也是一样的。感觉两者在考试前背了同一篇范文。

然后,那位同事把同样的 prompt 给到 ChatGPT,发现回答的内容也是同样的。现在真相大白了,原来都是抄的班上的学霸的作业,被老师集体抓包。只不过现在可以美其名曰「语料污染」。至于社会主义温室里的花朵是怎么会被资本主义的毒草给污染的,可能要去问茅台师傅,我就不清楚了。

不过,我还是推荐所有同事「能用到什么 AI 就用什么 AI,有得用总比没有强」。他们都去问 AI,也就不用老来烦我了。

2025-01-29

DeepSeek 风暴过境

图片来自网络,与本文无关

前天晚上,美股大跌。纳指跌了 3% 以上,然而道琼斯却是涨的。不知道出了啥事,去看新闻,才知道原来是美国人听说 DeepSeek 了。

要说这帮华尔街精英真的是反应慢。DeepSee k的事情就算是流传到大众耳朵里,也已经快一个星期了。现在再来暴跌这么一下,不知道他们是怎么想的。

看走势曲线,我就知道第二个交易日会进行修复,果然今天就涨回去一半。春节连假还长,等中国人重新上班,华尔街那边应该已经把这个事情消化得七七八八了。该咋地咋地,就有如一场风暴过境,一片狼藉之后继续过日子呗。

我不是 AI 精英,只是一个快退休的程序员而已。DeepSeek 在技术上有多牛逼,我不知道,不评论。我只是从我自己的角度,来说说这个事情。


美国人的确善于开创一个新的领域,而中国人的确善于把一个东西给做「烂」。虽然是「烂大街」的烂,但这个「烂」字在这里并不完全是贬义词。让王谢堂前燕飞入寻常百姓家,我完全同意这是好事一件。如果每个人都有「丰饶之角」,那么也就没有政府什么事了。

不过 DeepSeek 真的很便宜吗?可能倒也未必。官方宣称的训练成本,我是不清楚虚实,但官网上的价格,可不是真便宜。即使打过折,也就比通义千问低一些,一个 0.3 元,一个 0.1 元,并没到一个数量级的差别。这还是「缓存中」的情况,缓外的价格要 1 元,比通义千问的 qwen-plus(0.8 元)还贵。如果算它的所谓「原价」,那更是比肩通义千问(那又贵又慢)的 qwen-max,完全没有价格优势了。
我这里只说了输入价格,输出的情况也差不多,各位有兴趣可以自己去看。

至于效果,如果它只是「赶上」了 GPT-4o,那我完全也没有什么好期待的。跟你们人类聊聊天,可能看不出什么来,但如果也像我一样把它作为 ToB 的服务来用,就会发现所有的 LLM 都一样。有的聪明,有的笨拙,确实能看出差别。但 ToB 服务需要的是质量稳定如一。在这一点上,所有的 LLM 在我看来目前还都还不及格。

ToB 的另一个问题,中国式 AI 可就要命了。
我可以负责任地说,AI 相关的工作成本,我目前大部分都花在了对付敏感词上面,而且越来越多。客观地说,敏感词问题,所有 LLM 也都有,但只有中国式 AI 特别多,而且弥天漫地,涉及到方方面面。讲个老笑话,中国式 AI,只有两个不能说——这也不能说,那也不能说。

比较简单一点的,是把诸如「上游行业」看成「游行」这种。问题出在中国人实在是信不过 AI,非要在其输入前面和输出后面各套一个敏感词过滤系统。这也就是法新社试下来发现有时候能突破,随即 AI 又改口的原因。ChatGPT 当然也有这种现象,不过相比起来,中国式 AI 的容错率要低得多。公司也好,政府也好,在这方面完全「输不起」,所以也就格外地烦。

输入有敏感词还好,输出有敏感词,真的是令人恼火。因为输出不能给你看,你也不知道敏感词是什么。有的 AI 模型多试两次能绕开,有的死活不能。提工单吧,万一 AI 改了一种说法,可能还不一定能稳定重现。客服说在 prompt 内加上「请避开敏感内容」,但是在今天的中国,比起模型更新速度来,敏感词的变化可是要快多了。

可能是因为时局原因吧,我最近这半年遇到的敏感词问题,特别是输出敏感词问题,比之前要多得多。主观感觉上,2024 年最后一个季度比起前面大半年,出现的频率明显变多,大概有三、四倍的样子。偏偏金融行业,几乎躲不过中国的敏感词问题。DeepSeek 再牛逼,如果解决不了这个问题,在商用的时候一样会遇到麻烦。道理很简单:你再便宜,成本再低,一个问题需要客户重复三五遍,白菜也给盘成肉价钱了。

说到底,DeepSeek 眼下貌似成功的地方,和将来可能会失败的地方,都跟实体经济领域的情况别无二致。太阳底下无新事。我看得出,别人也看得出。「开源」目前看来是一步不错的好棋,不管结局如何,起码将来在历史上会有一席之地。只是,希望是真正的开源就是了。

太阳底下无新事。