Aller au contenu principal
Github-star-radar
Langage · Cuda

Cuda

Dépôts open source suivis ayant Cuda pour langage principal, triés par étoiles.

61 dépôts
  • llm.c@karpathy

    Entraînement de LLM en C/CUDA simple et brut

    30 886+44Évolution des étoiles sur les 7 derniers jours
  • instant-ngp@NVlabs

    Primitives graphiques neuronales instantanées : NeRF ultra-rapide et plus encore.

    17 536+13Évolution des étoiles sur les 7 derniers jours
  • LeetCUDA@xlite-dev

    Notes d'apprentissage modernes sur CUDA avec PyTorch pour débutants, incluant plus de 200 noyaux CUDA, Tensor Cores, HGEMM, FA-2 MMA.

    11 838+42Évolution des étoiles sur les 7 derniers jours
  • HVM2@HigherOrderCO

    Un runtime fonctionnel optimal et massivement parallèle écrit en Rust.

    11 340+1Évolution des étoiles sur les 7 derniers jours
  • DeepEP@deepseek-ai

    DeepEP : une bibliothèque de communication efficace pour le parallélisme d'experts

    10 070+27Évolution des étoiles sur les 7 derniers jours
  • DeepGEMM@deepseek-ai

    DeepGEMM : bibliothèque de noyaux BLAS propre et efficace sur GPU

    7 743+29Évolution des étoiles sur les 7 derniers jours
  • Implémentation officielle de notre article CVPR2019 "Deep High-Resolution Representation Learning for Human Pose Estimation".

    4 480+1Évolution des étoiles sur les 7 derniers jours
  • warp-ctc@baidu-research

    CTC parallèle rapide.

    4 069+0Évolution des étoiles sur les 7 derniers jours
  • cuda-course@Infatoshi
    3 980+19Évolution des étoiles sur les 7 derniers jours
  • SageAttention@thu-ml

    [ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention permet une accélération de 2 à 5x par rapport à FlashAttention, sans perte de métriques de bout en bout pour les modèles de langage, d'image et de vidéo.

    3 683+23Évolution des étoiles sur les 7 derniers jours
  • ThunderKittens@HazyResearch

    Primitives de tuiles pour des noyaux rapides.

    3 658+18Évolution des étoiles sur les 7 derniers jours
  • Guide d'optimisation d'algorithmes en CUDA.

    3 224+17Évolution des étoiles sur les 7 derniers jours
  • AlexNet-Source-Code@computerhistory

    Ce paquet contient le code original d'AlexNet de 2012.

    2 971+6Évolution des étoiles sur les 7 derniers jours
  • CUDA_Freshman@Tony-Tan
    2 794+3Évolution des étoiles sur les 7 derniers jours
  • Exemples de bibliothèque CUDA.

    2 489+6Évolution des étoiles sur les 7 derniers jours
  • mirage@mirage-project

    Mirage Persistent Kernel : compilation de LLM dans un MegaKernel.

    2 458+22Évolution des étoiles sur les 7 derniers jours
  • cugraph@rapidsai

    cuGraph - Bibliothèque d'analyse de graphes RAPIDS

    2 227+7Évolution des étoiles sur les 7 derniers jours
  • CUDA-Programming@brucefan1983

    Exemples de code pour mon livre sur la programmation CUDA

    2 091+1Évolution des étoiles sur les 7 derniers jours
  • tsne-cuda@CannyLab

    t-SNE accéléré par GPU pour CUDA avec des bindings Python.

    1 957+2Évolution des étoiles sur les 7 derniers jours
  • nccl-tests@NVIDIA

    Tests NCCL.

    1 639+11Évolution des étoiles sur les 7 derniers jours
  • diff-gaussian-rasterization@graphdeco-inria
    1 489+2Évolution des étoiles sur les 7 derniers jours
  • torchsparse@mit-han-lab

    [MICRO'23, MLSys'22] TorchSparse : Framework d'entraînement et d'inférence efficace pour la convolution creuse sur GPU

    1 472+0Évolution des étoiles sur les 7 derniers jours
  • k2@k2-fsa

    Algorithmes FSA/FST, différentiables, avec compatibilité PyTorch.

    1 352+1Évolution des étoiles sur les 7 derniers jours
  • rtp-llm@alibaba

    RTP-LLM : moteur d'inférence LLM haute performance d'Alibaba pour diverses applications.

    1 318+6Évolution des étoiles sur les 7 derniers jours
  • SGEMM_CUDA@siboehm

    Multiplication de matrices CUDA rapide développée à partir de zéro

    1 294+8Évolution des étoiles sur les 7 derniers jours
  • FlashKDA@MoonshotAI

    FlashKDA : noyaux d'attention Kimi Delta haute performance.

    1 231+8Évolution des étoiles sur les 7 derniers jours
  • Flash Attention en environ 100 lignes de CUDA (passe avant uniquement).

    1 179+1Évolution des étoiles sur les 7 derniers jours
  • CUDA_Kernel_Samples@Tongkaio

    Guide d'implémentation et d'entretien pour les opérateurs CUDA

    1 097+7Évolution des étoiles sur les 7 derniers jours
  • Supports de formation associés à la série de formations CUDA de NVIDIA (www.olcf.ornl.gov/cuda-training-series/)

    1 043+6Évolution des étoiles sur les 7 derniers jours
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention : Une attention creuse sans entraînement qui accélère l'inférence de tout modèle.

    1 037+7Évolution des étoiles sur les 7 derniers jours
← Retour aux langages