• 发布日期
    2025 年 5 月 14 日
  • 分享

“Nöronlar hayatta kalmak için birbirleriyle sürekli rekabet içindedir。她的 nöron ve nöronlar arasındaki her bağlantı,kaynaklar için bir diğeriyle mücadele halindedir。Bu sınır savaşları beynin ömrü süresince devam ederken haritalar、kişinin deneyim ve hedeflerini beynin yapısına yansıtacak şekilde sürekli Yeiden çizilir。

Bir muhasebeci piyanist olmak üzere kariyerini bırakırsa parmaklarına ayrılmış olan nöral alanlar genişleyecek, mikroskopi uzmanı olmaya karar verirse görme korteksi, aradığı küçük ayrıntılara parallel olarak daha yüksek çözünürlük özelliği geliştirecektir。”

坎利·德夫雷,大卫·伊格曼

它是如何开始的?

它是如何开始的?

Sadece bir yazıda tüm yapay zeka çalışmalarını anlatmak takdir edersiniz ki mümkün değil。您可以通过以下方式进行操作:

ImageNet 于 13 月开始使用 AlexNet 模型。 2012 年 AlexNet 的主要模型是基于 GPU(图形处理单元)的,它是基于模型的:

13 年前,NVIDIA 推出了一款全新的 NVIDIA 显卡。 [2]Devamındaki süreçte ekran kartlarının kabiliyetleri ve alan ilgi arttıkça daha büyük yani daha çok parametreli ve daha çok gizli katman içeren modeller hayatımıza girmeye başladı。

Böylece daha kaliteli görüntü,sinyal,视频模型 görmeye başladık。 Büyük modelleri orijinalinde yer almayan görevler için az miktarda veri ve işlem gücüyle eğitmeye dayalı Fine-tune, 迁移学习 gibi kavramlar hayatımıza girdi. Lakin doğal dil için büyük bir model uretmek hala mümkün değildi. 

如果问题是您所需要的,那么您只需注意即可。 8 月,Google 推出了 Transformer。艺术“büyük”diye ifade edebileceğimiz doğal dil modelleri yani LLM'leri eğitebiliyorduk。 [4]

2022 年,(yani Bundan sadece 3 年)ise belki de en önemli adımlardan biri OpenAI tarafından atıldı ve o güne kadar eğitilen hiçbir modelin gosteremediği bir Reasoning (muhakeme) kabiliyetine sahip olduğu gösteren ChatGPT 平台是旧的。

她的建模工具是görevinin sabit olduğu ve eğitim öncesinde belirlendiği klasik makine öğrenmesi ve derin öğrenme modellerin aksine modelin görevinin doğal dil ile değiştirilebildiği Few-shot / Zero-shot modellerinin ilki olmasa da, ChatGPT platformunda Sunulan 和 GPT-3 可以对 GPT 模型进行微调,并重新制定任务。 Tamam ama bu neden bu kadar önemli? 

ChatGPT'den sadece birkaç yıl önce bir Problemi çözmek için eğitilen her model sadece ilgili model üzerinde çalışabilyordu. Mesela 2020年的 Kaggle 推文情感分析是我的最爱,推文的作者是伊甸园中的模型作者,我们的推文情感分析。 Bu modellerden birini alıp başka bir doğal dil görevinde kullanamazdınız。 Örneğin tweet'inhangi dilde yazıldığını modele soramazdınız。请注意以下事项。 Yani konuyla ilgili en az bir uzmana ihtiyaç vardı。 ChatGPT ile bu durum ortadan kalktı。该作品是由模型制作而成的。 ChatGPT 模型由 görevini doğal dil ile(卡巴卡提示符)生成。在dilini sınıflandırın 中发推文,ister duygu durumunu。请注意。 [5]

如今

Evet artık bir uzmana ihtiyacımız yok。 Bilgisayar bilimci olmak zorunda değilsiniz。 Kodlama bilmeye de gerek yok。微调?迁移学习?埃伊蒂姆? Artık hiçbirine gerek yok。 Yazıp konuşabilyorsanız bu Yeterli。 OpenAI 1 月 8 日在 1'de 6'ine 上推出。 Bu da demek oluyor ki LLM'ler artık insan hayatının bir parçası haline geldi。 [XNUMX]

Peki son zamanlarda LLM alanında ne gibi Yenilikler oldu?

Peki son zamanlarda LLM alanında ne gibi Yenilikler oldu?

法学硕士的“zeka”艺术是他的一项重要研究成果。 Araştırmalar,锌尼尔-düşünce sistemlerinin küçük göstergelerle 胆业问题 çözme oranını 戏剧双imde artırdığını ortaya koyuyor。 OpenAI 于 2024 年推出了第 1 系列“daha​​ uzun düşünüp sonra cevap veren”等建模者 olarak konumlandırdı。 Devasa parametre sayıları, exaFLOPS ölçekli eğitim kümeleri ve milyarlarca token, 2020-2024 arası inovasyonun un mottosu oldu. Talebin tetiklediği bu dönem, Nvidia'nın piyasa değerini dokuz ayda 1 trilyon $'dan 3 trilyon $'a taşıdı;其分析仪“AI çağının petrol devi” diye tanımlamaya başladı。 [7] Durumu daha iyi kavrayabilmek için şu grafikleri inceleyelim:

Epoch.ai'den aldığımız ilk grafikte özellikle öğrenme tekniğinin in popüler olması ile birlikte model eğitmek için gereken işlem gücünün (FLOP cinsinden) yılda ortalama 4.6 kat arttığını görebiliyoruz。 Kısaca 她 yıl 5 kat daha fazla işlem gücüne ihtiyaç duyuyoruz。 [8]

SEC(证券交易委员会)表示,2019-2024 年,NVIDIA 将在 S&P 500 和纳斯达克 100 指数上进行测试。 Yani 的儿子是 NVIDIA 的儿子,他的儿子雅尼 (Yani) 的儿子是 NVIDIA 的儿子,他的儿子雅尼 (Yani) 的儿子雅尼 (Yani) 的儿子雅尼 (Yani) 的儿子雅尼 (Yani) [9] 

我的涂鸦是关于其他地方的,请注意,我的技术是我的技术,并且是我的技术。我的 yandan 模型是基于 NVIDIA 的 NVIDIA 技术而设计的,它是由 Benzer 设计的。

Fakat bu trendi bozan bazı özel gelişmelerden de bahsetmemiz gerek。在 2025 年,在 DeepSeek 的合并中,Reasoner-R1 的价格为 0,55 $/M 代币,可重新设计模型,并使用该代币进行设计。 Potansiyeli taşıdığını gosterdi。正常的 OpenAI GPT-4o modelinin fiyatı 1 milyon 输出 (çıkış) token'i için 10 $ iken, DeepSeek R1 aynı işi 2,19 $'a yapıp; gece indirimiyle bu rakam 0,55 $'a kadar düşürdü。 OpenAI'den DeepSeek'e 是一个旧的 DeepSeek 工具,它具有 40 个基本选项。 [10]

DeepSeek'in Rakipleri ile arasındaki fiyat uçurumunu gosteren bir infografik.

请注意以下事项: DeepSeek'in yayınladığı rapor,671 milyar parametreye sahip R1 modellerinin nasıl üst düzey muhakeme Yeteneği sağladığını detaylı biçimde ortaya koyuyordu。在 R1 中,您可以使用 OpenAI GPT-4 模型来重新启动它,然后单击“daha​​ fazla işlem gücü eşittir daha iyi muhakeme”。 Guardian“DeepSeek Paniği”başlıklı haberinde vurguladığı gibi,R1'in kamuya açılması Nvidia hisselerinin ilk işlem gününde %18 değer kaybederek yaklaşık 600 milyar dolarlık tarihi bir düşüş yaşamasına neden oldu。 [11]

详细说明如何使用 DeepSeek 进行优化,以优化 DeepSeek 的性能。在 sadece Hooper mimarisine sahip kartlarda 和 FlashMLA ki burada DeepSeek'in elinde iyi miktarda Hopper mimarisine sahip H800(NVIDIA tarafından çin pazarına sunulan H100 muadili ekran kartı)bulunduğuna ve R1'in bu kartlarda eğitildiğine dikkat çekelim。 Ya da MoE(专家混合)olarak adlandırılan ve modelin sahip olduğu toplam 671 milyar parametre içinden her işlemde yalnızca küçük bir bölümü (37 milyar parametre gibi) aktif olarak kullanılarak hesaplama maliyeti önemli ölçüde azaltan yöntemler örnek verilebilir。 [12]

奥拉拉克 DeepSeek-R1 的性能是通过经济模型来实现的,它是在蒸馏过程中进行的。 Eğitim ve çalıştırmamaliyetlerinde kayda değer optimizasyonlar yapılmış olsa da R1 hala 671 milyar parametre içeriyor yani sadece çalıştırmak için bile >400GB VRAM (4 bit quantization'a rağmen) lazım (RTX 4090) sadece 24GB VRAM içerdiğine dikkat çekelim)。 Bu durum bizati farkında olan DeepSeek kaliteli ama daha küçük modeller eğitmek amacıyla, hali hazırda güçlü ve yüksek kapasiteli R1 modelinin ürettiği yine yüksek kaliteli yaklaşık 800 bin örneklik sanal veri kümesini kullanarak daha küçük modellerin eğitimi için kullanmış。我们可以使用 70、32、14、8、7 和 1,5 种 R1 模型来开发 DeepSeek 模型,但仍可以使用 R1 思维模型进行设计。 [13]

DeepSeek'in detaylarından sonra geldiğimiz noktayı kabaca özetlersek 3 yıl önce ChatGPT ile birlikte doğal dil ile modele ya da ha generic bir isim ile yapay zekaya görev atayabilir hale geldik. Başlangıçta Bunlar basit görevlerdi。 Daha önce verdiğimiz örnekler gibi mesela bir menin dilini sınıflandırmak ya da farklı bir ile Yetiden yazdırmak。 Devamında ise beklentileri karşılamak adına birçok Yeni teknik ortaya çıktı ve yapay zekanın tek seferde tek bir prompt ile yapabildiği görevlerin kapasitesi arttı. Bunu şu grafikte çok net görebiliriz [14]:

2023 年,我们的标准材料测试已达到 %30,并且模型设计师的艺术水平已达到 90%。 Daha iyi 推理 yani muhakeme Yeteneğine sahipler。 Daha karmaşık 问题 çözebiliyorlar。

Peki bu bizim için bir durak noktası mı?艾尔贝特·德伊尔。请注意,请注意以下事项。 Öyle ki bir insanla aynı seviyede。您可以通过以下方式进行操作:您可以使用 AGI(通用人工智能)来实现人工智能。如果您使用了 yapay zeka,则可以使用 yapay zeka 或 yapay zeka 来解决此问题。

Burada muhakeme Yeteneğini kabaca bir başarı ölçütü olarak görebiliriz。如果您遇到任何问题或问题,请联系我们。 Galaksiya olarak 的业务,包括 RAG'a(检索增强一代)和 devamında mevcut modellerden daha yüksek muhakeme Yeteneğinin elde edilmesi üzerine odaklandık。 MindGraph 是知识图谱(Knowledge Graph,简称知识图谱),它是一种简单的知识图谱。

思维图

思维图

但是,LLM 的 hayatımıza girmesiyle iyice anlam kazanmış ve hala aktif olarak üzerine çalışılan konulardan biri olan RAG'ın(检索增强一代)ne olduğundan bahsetmeliyiz。 Daha önce de bahsettiğimiz gibi LLM'ler eğitildikleri verileri kullanarak girilen Prompt'lara cevap üretebiliyorlar。 Örneğin bir LLM'e“Avrupa'nın yüzölçümü nedir?” gibi bir soru sorarsanız doğru cevabı alırsınız (istisnalar dışında)。是吗? Hatta dinamik bir şekilde her gün değişmeye başlarsa? LLM'de bu bilgiyi nasıl güncelleyeceğiz? Başka bir örnek verelim。法学硕士是一名法学硕士。 Soular soruyoruz ve cevap alabiliyoruz。 Peki ama sürekli değişen ya da halka kapalı olan(私人)veriler hakkında ki sorularımıza nasıl cevap alacağız? Mesela bir şirket yönetmeliği, finansallar ya da yasalar。 Kısaca LLM'lerin private ya da dinamik veriler hakkında doğru cevaplar üretmesini nasıl sağlarız?

Śte bu soruya şu an verilebilecek ilk cevap RAG。 RAG'ın temel amacı sorulacak olan soruya uygun cevabı içeren veriyi soruyla birlikte Prompt içerisinde vermek. Böylece ilgili veriyle modeli Yeniden eğitmeden LLM veri ile ilgili sorulara cevap verebilir hale geliyor(En azından teoride)。我已经把它放在一边了。 Bunlardan en önemlisi 上下文窗口限制。上下文窗口 kabaca bir LLM'in tek seferde girdi ve çıktı olarak işleyebileceği toplam token (bknz: 符号化)说是说。请输入以下信息。 Eski derin öğrenme modellerini düşünün。 Bir örneklemin boyutu she zaman sabit idi。 CNN 的模特是 Resmin boyutu,她的名字是 CNN 的模特。 Bu bugün de geçerli ve modelden modele gore değişiyor。您可以使用 GPT 模型来购买 128,000 个代币卡达尔。 75 kelimnin kabaca 100 token yaptığını düşünürsek bu da kabaca 250 sayfalık bir kitap yapar. Yani bizim 是私人的,是私人的,并且是安全的。 [15] 

该问题是 tüm veriyi modele verebildiğimiz durumlarda dahi her zaman doğru cevabı alamayabiliriz。请注意,请注意以下事项: Bu durumu daha iyi ifade edebilmek için bir metafor kullanalım。 Farz edelim ki bir insan uzmana 250 sayfalık bir kitap verip kitapta geçen isimleri alfabetik sırayla söylemesini isteyelim。 Uzmanın tamamlaması gereken adımlar kabaca şu şekilde olurdu:

  1. Kitapta geçen tüm isimleri atlamadan tek tek bir yere not al。
  2. Daha sonra 不是 alınan tüm isimleri alfabetik olarak sırala。

Görüldüğü üzere bu sorunun çözümü tek bir adımdan oluşmuyor en azından makul bir çözüm için en az iki adıma dolayısıyla bu adımları oluşturmak için beli bir seviyede muhakeme Yeteneğine ihtiyacı var. 

有什么问题吗?

Birinci 问题解决了上下文窗口中的问题。 Yani veriyi bir şekilde kısaltmamız ya da filtrelememiz lazım ve Bunu yaparken mümkünse sorunun cevabını içeren kısma zarar vermememiz lazım。 Bu noktada sıklıkla tercih edilen yollardan biri vektörleri kullanmak [15]:

  1. Öncelikle metin chunk (küçük metin parçaları) bölünür。
  2. 简单地说,嵌入模型是一种非常简单的方法。
  3. Daha sonra bu vektörler bir veritabanında saklanır。
  4. Kullanıcı soru sorduğu zaman ilgili soruda vektöre dönüştürülür。
  5. Sorunun vektörüne en yakın(genelde kosinüs benzerliği kullanılıyor)olan k sayıda vektör getirilip soru ile birlikte LLM'e verilir.

Böylece 会在上下文窗口中过滤掉所有内容。 Vektör çözümü 基本基本为 bu alanda sıklıkla kullanılan bir çözüm。

这是一个问题。 Çünkü sorulan soruyu alt sorunlara parçalamayı ve alt çözüm adımları oluşturmayı gerektiriyor。解决问题的方法是解决问题。 Kabaca LLM'lerden nasıl daha yüksek muhakeme Yeteneği elde edebiliriz? 

Doğal olarak bu alan üzerine çalışan neredeyse Herkes bu Problem üzerine eğilmiş durumda。 Bunlara 思维模型是在 skorlama ajanları içeren çok ajanlı yapıları örnek verebiliriz 中实现的。 MindGraph 中的业务问题是迷你版的。

MindGraph 的设计理念是,节点和边缘节点都可以正常工作。我希望我能用它来帮助我解决这个问题。 Bu açıdan beyne ve noronların yapısına bezetebiliriz [17]。

MindGraph 的问题是什么?解决 başlayalım 的问题。解决这个问题的关键是解决问题,并解决这个问题。 Burada ne kadar iyi bir filtreleme yaparsak or kadar iyi bir cevap alabildiğimizden ve bu Problem için generic olarak vektör tabanlı çözümler kullanıldığından daha önce bahsetmiştik. Lakin vektör tabanlı yaklaşımlarında kendine 有 bazı alt sorunları mevcut。

过滤器过滤器是在第三次过滤器中过滤的,该过滤器的过滤器是大块的,因此,过滤器中的过滤器会自动过滤掉。 Bu nedenle fitreleme için sabit bir sayı kullanıyoruz ve sıralanan chunk'lar arasından sadece bu sabit sayı kadar chunk seçmek durumunda kalıyoruz(布纳顶级 k 选择否认)。 Kullanılan sabit sayı bu çözümde bir hiper parametre olmuş oluyor ve ne olacağı verinin türüne, içeriğe ve konuya gore değişiklik gösterebiliyor.

因此,请注意以下事项。她的车辆是在 800 卡拉克特上使用的。 Ama ya sorulan soruya cevap vermek için gereken 最低 alan en az 2000 karakterden oluşuyorsa ne olacak? Hem sorduğumuz soruyu parçalanan chunklar ile eşleştiremiyoruz hemde ilgili alanı neredeyse tam ortadan ikiye böldüğümüz için ciddi miktarda informasyon kaybediyoruz。 Bir çözüm olarak daha yüksek bir sabit sayı kullanıp chunk'ları büyütebiliriz。我不会告诉你任何信息。 Dahası tam ters bir etki yaparak cevabı çok küçük bir alan (mesela 200 karakter) bir bölgeyi bulmızı çok daha zor hale getiriyor。

在此过程中,MindGraph 的操作方法是通过 KG 的操作来实现的。 Bunun için önce veriyi bir bilgi çizgesine oturtuyoruz。 Böylece 非结构化 yani düzensiz ve ham metin verisini 结构化 yani düzenli bir hale getiriyoruz。 Daha sonra ise 图形引擎 dilinde SQL benzeri sorgular yazarak veriyi filtreliyoruz [18]。

Örneğin yukarıda bulunan KG'a bakalım。库拉尼奇 钢铁侠'in tüm yapımcılarını sırala gibi bir soru soru sormuş olsun。 Bu soruyu cevaplamak için yapmamız gereken çok basit bir 暗号 科杜伊莱 钢铁侠 düğümüne ait tüm komşuları getirmek ve soru ile birlikte LLM'e vermek。

Bu Sayede sorulan soruyla ilgili gereken tüm bilgileri, parçalamadan, Structured yani düzgün ve öz biçimde LLM'e verebilmiş oluyoruz。 Filtrelemeyi ise sorulan soruda geçen özneye göre çok rahat bir şekilde yapabildik。

解决 MindGraph 问题的方法 [19]。

Yukarıdaki bilgi çizgesini incelediğimizde kişileri,arkadaşlarınıve çalıştıkları şirketleri içeren basit bir yapi görüyoruz。 Farz edelim ki kullanıcı Jennifer'in tümarkadaşlarınıve çalıştıklarıfirmaları sırala lütfen。 şeklinde bir soru soru sormuş olsun。当您将本泽利克车辆置于 Cevaplamak isteseydik 上时,请注意将本泽利克车辆置于大块车辆中。 Ve böylece kalitesiz bir cevap almış olacaktık。阿玛内登?

詹妮弗在 X 中遇到了类似的情况,她在 X 里的旧衣服上看到了 X'in Y 的照片,然后发现了她的新衣服。 Mesela farklı iki dokümanın çok farklı sayfalarında。 Bunun ikinci nedeni ise sorunun iki adımdan oluşuyor olması:

詹妮弗在 arkadaşlarını bul。

布卢南 arkadaşların çalıştıkları şirketleri bul。

yani tesadüfen eksiksiz ve öz miktarda chunk ve informasyonu filtreleyip LLM'e verdiğimiz farz etsek bile LLM'e ham veriyi verip veriler arasında ilişki kurmasını yani muhakeme Yeteneği göstermesi bekliyoruz。 Hem de hiçbir yol göstermeden。

Şimdi ise MindGraph kullandığımız durumda ise tek yapmamız gereken:

  • Jennifer(珍妮弗)'我,
  • 是朋友 超越障碍
  • 工作 üzerinden çalıştıkları şirketleri

getiren basit bir Cypher 查询 yazmak。 Daha sonra dönen bilgiyi soru ile LLM'e vermek。 Bu Sayede LLM'i az ve oz miktarda bilgi ile beslemiş ve gereksiz bilgiden arındırmış oluyoruz。 Daha önemlisi ise bilgilerde geçen nesne, özne ve kavramları yani kısacaEntity'leri ve Edge yapısında birbirlerine bağlışekilde verdiğimiz için muhtemel muhakeme yollarını LLM'e işaret etmiş oluyoruz.

CEmONC

就这样,MindGraph 就可以通过测试器进行测试了,并且可以验证它的效果。 

MindGraph 是 RAG 的经典之作,它具有强大的功能和强大的艺术表现力。重新安装后,RAG yerine doğrudan 会在 9000 小时内进行微调,并在模型上进行微调。最多可支付 XNUMX 美元。 MindGraph 是一个非常好的工具,可以帮助您更好地理解 MindGraph。

MindGraph 的前身是这样的,它可以在某些情况下使用。 Diyelim ki bir gıda şirketinde uretimden sorumlu bir yöneticisiniz。 Üretim hattınızda kritik bir ekipman olan paketleme makinesi durdu ve hızlıca karar vermeniz gerekiyor。 “Paketleme makinesi durursa、önümüzdeki ay sipariş teslimatlarımız、stoklarımız ve lojistik nasıl etkilenir?” gibi bir soruya geleneksel vektör RAG yöntemleriyle doğru cevap almak oldukça zor olacaktır。 Çünkü bu tarz sorular çok sayıda verinin analiz edilmesini ve karmaşık ilişkilerin değerlendirilmesini gerektiriyor。 Oysa MindGraph 表示,它是一个非常好的工具,它可以为您提供更方便的绘图选项。

Bir başka örnekte ise daha stratejik bir soruya odaklanalım。 Erdem,Galaksiya'nın büyük ortağıdır。 Galaksiya 是 Deepin'in,Deepin de Twinize'in büyük ortağı konumundadır。 Şimdi Erdem 的策略是通过以下方式解决问题:

  • “Deepin şirketindeki hisse oranımız %20 azalırsa,Twinize üzerindeki doğrudan ve dolaylı kontrolümüz nasıl etkilenir?”
  • “Galaksiya olarak Twinize'ın büyümesinden elde edeceğimiz toplam değer artışı,Deepin'deki olası bir küçülmenin yaratacağı zararı telafi eder mi?”

但是,我认为卡特曼是一个非常有名的人,也是一个基本的 RAG 人,他是一位非常出色的人。 MindGraph 是一个功能强大的工具,可以帮助您解决问题。 Böylece herhangi bir uzman müdahalesine veya Yeni bir eğitim sürecine gerek kalmadan, bu soruların yanıtlarını net olarak alabilmekteyiz.

MindGraph 是一种先进的技术。她对模型进行微调时,需要注意的是,MindGraph 会根据您的需要调整模型并进行适当的调整。 Bu sayede hem maliyetleri düşürüyor, hem de operasyonel süreçleri basitleştiriyoruz.

Galaksiya olarak、MindGraph Metodunu geliştirmeyi、bilgi çizgesi tabanlı yaklaşımları yüksek muhakeme Yeteneği gerektiren tüm alanlarda uygulamayı ve bu yöntemlerle yapay zeka modellerinin kabiliyetlerini daha da ileri taşımayı sürdürmekteyiz。 Bir sonraki adımda sizlerle daha detaylı benchmark sonuçları paylaşıyor olacağız.奥扎马纳·卡达尔

保持冷静 ...

Behçet ŞENTÜRK,机器学习工程师

参考

[1]:viso.ai。2024年。“AlexNet:革命性的深度学习架构。”最后访问于5月XNUMX日。 https://viso.ai/deep-learning/alexnet/.

[2]:CNBC。2025年。“英伟达再次超越苹果,成为全球最有价值的公司。”最后访问于5月XNUMX日。 https://www.cnbc.com/2025/01/21/nvidia-passes-apple-again-to-become-worlds-most-valuable-company-.html.

[3]:神经网络与深度学习。2019 年。“为什么深度神经网络难以训练?”最后访问于 5 月 5 日。http://neuralnetworksanddeeplearning.com/chapXNUMX.html。

[4]:Vaswani、Ashish、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan N. Gomez、Lukasz Kaiser 和 Illia Polosukhin。 2017 年。“你所需要的就是注意力。” arXiv(康奈尔大学),一月。 https://doi.org/10.48550/arxiv.1706.03762。

[5]: kaggle。2020 年。“推文情绪提取”。上次访问时间为 5 月 XNUMX 日。https://www.kaggle.com/competitions/tweet-sentiment-extraction/overview。

[6]:福布斯。2025 年。“ChatGPT 用户数突破 1 亿?OpenAI 首席执行官称‘短短几周内翻了一番’。” 最后访问于 5 月 XNUMX 日。 https://www.forbes.com/sites/martineparis/2025/04/12/chatgpt-hits-1-billion-users-openai-ceo-says-doubled-in-weeks/.

[7]:科技杂志。2024 年。“人工智能热潮推动英伟达市值超越微软。” 最后访问于 5 月 XNUMX 日。 https://technologymagazine.com/digital-transformation/gen-ai-boom-causes-nvidia-value-to-overtake-microsoft.

[8] EPOCH AI。2025 年。“值得关注的人工智能模型”。上次访问时间为 5 月 XNUMX 日。https://epoch.ai/data/notable-ai-models。

[9]: SEC. 2024.“NVIDIA CORPORATION。”上次访问时间为5月1045810日。https://www.sec.gov/Archives/edgar/data/000104581024000029/20240128/nvda-XNUMX.htm。

[10]:路透社。2025 年。“DeepSeek 让欧洲科技公司有机会在全球人工智能竞赛中迎头赶上”上次访问时间为 5 月 2025 日。https://www.reuters.com/technology/artificial-intelligence/deepseek-gives-europes-tech-firms-chance-catch-up-global-ai-race-02-03-XNUMX/。

[11]:《卫报》。2025 年。“DeepSeek 引发股市抛售,科技亿万富翁损失近 100 亿美元。” 最后访问于 5 月 XNUMX 日。 https://www.theguardian.com/technology/2025/jan/28/deepseek-selloff.

[12] github。2025 年。“FlashMLA”。最后访问于 5 月 XNUMX 日。https://github.com/deepseek-ai/FlashMLA。

[13]: ollama。2025 年。“deepseek-r1”。最后访问于 5 月 XNUMX 日。 https://ollama.com/library/deepseek-r1:671b.

[14] EPOCH AI。2025 年。“美国模型目前表现优于非美国模型。” 最后访问于 5 月 XNUMX 日。https://epoch.ai/data-insights/us-vs-non-us-performance。

[15]: openai。2025 年。“什么是代币以及如何计算它们?”最后访问于 5 月 XNUMX 日。 https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them.

[16]:E2E 云。2025 年。“使用 Elasticsearch 向量数据库实现高级 RAG 技术。” 最后访问于 5 月 XNUMX 日。 https://www.e2enetworks.com/blog/implementing-advanced-rag-techniques-with-elasticsearch-vector-db.

[17]:肖明清、朱一欣、何迪和林舟辰。2024 年。“用于图推理的具有突触延迟的时间脉冲神经网络。”arXiv(康奈尔大学),XNUMX 月。 https://doi.org/10.48550/arxiv.2405.16851.

[18]:李俊毅、唐天一、赵炜欣、魏志成、袁静、温继荣。2021 年。“基于预训练语言模型的少样本知识图谱到文本生成。”arXiv(康奈尔大学),XNUMX 月。 https://doi.org/10.48550/arxiv.2106.01623.

[19]:Analytics Yogi。2022 年。“英伟达再次超越苹果,成为全球最有价值的公司。” 最后访问于 5 月 XNUMX 日。https://vitalflux.com/nosql-data-models-concepts-examples/。