<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-os vector-sticky-header-enabled" lang="en" dir="ltr"><head>
    <meta charset="UTF-8">
    <title>Llama.cpp</title>
    <meta name="viewport" content="width=device-width, initial-scale=1.0">
    <link rel="icon" type="image/png" href="./_res_/favicon.png">
    <link rel="canonical" href="https://en.wikipedia.org/wiki/Llama.cpp"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
    <link href="./_mw_/ext.pygments.css" rel="stylesheet" type="text/css">
    <link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
    <link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
    <link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
    <link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
    <meta name="ResourceLoaderDynamicStyles" content="">
    
    <link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
    <link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
    <link rel="stylesheet" type="text/css" href="./_res_/footer.css">
    <link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
  </head>
  <body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Llama_cpp rootpage-Llama_cpp skin-vector-2022 action-view">
    <div class="mw-page-container">
      <div class="mw-page-container-inner">
        <div class="mw-content-container">
          <main id="content" class="mw-body">
            <header class="mw-body-header vector-page-titlebar">
              <h1 id="firstHeading" class="firstHeading mw-first-heading">llama.cpp</h1>
            </header>
            <a id="top"></a>
            <div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
              <div id="contentSub">
                <div id="mw-content-subtitle"></div>
              </div>
              <div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="en" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="en" dir="ltr">
<style data-mw-deduplicate="TemplateStyles:r1316064257">
/* start https://en.wikipedia.org/ */


.mw-parser-output .infobox-subbox{padding:0;border:none;margin:-3px;width:auto;min-width:100%;font-size:100%;clear:none;float:none;background-color:transparent;color:inherit}.mw-parser-output .infobox-3cols-child{margin:-3px}.mw-parser-output .infobox .navbar{font-size:100%}@media screen{html.skin-theme-clientpref-night .mw-parser-output .infobox-full-data:not(.notheme)>div:not(.notheme)[style]{background:#1f1f23!important;color:#f8f9fa}}@media screen and (prefers-color-scheme:dark){html.skin-theme-clientpref-os .mw-parser-output .infobox-full-data:not(.notheme)>div:not(.notheme)[style]{background:#1f1f23!important;color:#f8f9fa}}@media(min-width:640px){body.skin--responsive .mw-parser-output .infobox-table{display:table!important}body.skin--responsive .mw-parser-output .infobox-table>caption{display:table-caption!important}body.skin--responsive .mw-parser-output .infobox-table>tbody{display:table-row-group}body.skin--responsive .mw-parser-output .infobox-table th,body.skin--responsive .mw-parser-output .infobox-table td{padding-left:inherit;padding-right:inherit}}


/* end   https://en.wikipedia.org/ */
</style><table class="infobox vevent"><tbody><tr><th colspan="2" class="infobox-above summary">llama.cpp</th></tr><tr><td colspan="2" class="infobox-image logo"><span class="mw-default-size" typeof="mw:File/Frameless"><img src="./_assets_/0c70a452f799bfe840676ee341124611/Llama1-logo.svg.png" decoding="async" width="250" height="83" class="mw-file-element" data-file-width="512" data-file-height="171" loading="lazy"></span></td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;"><a href="Programmer" title="Programmer">Original author</a></th><td class="infobox-data">Georgi Gerganov</td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;"><a href="Programmer" title="Programmer">Developers</a></th><td class="infobox-data">Georgi Gerganov and community</td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;">Initial release</th><td class="infobox-data">March&nbsp;10, 2023<span style="display:none">&nbsp;(<span class="bday dtstart published updated">2023-03-10</span>)</span><sup id="cite_ref-githubrelease_1-0" class="reference"><a href="#cite_note-githubrelease-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup></td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;">Written in</th><td class="infobox-data"><a href="C%2B%2B" title="C++">C++</a>, <a href="C_(programming_language)" title="C (programming language)">C</a></td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;"><a href="Software_categories#Categorization_approaches" title="Software categories">Type</a></th><td class="infobox-data"><a href="Library_(computing)" title="Library (computing)">Library</a> for <a href="Large_language_model" title="Large language model">large language models</a></td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;"><a href="Software_license" title="Software license">License</a></th><td class="infobox-data"><a href="MIT_License" title="MIT License">MIT License</a><sup id="cite_ref-license_2-0" class="reference"><a href="#cite_note-license-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup></td></tr><tr><th scope="row" class="infobox-label" style="white-space: nowrap;"><a href="Repository_(version_control)" title="Repository (version control)">Repository</a></th><td class="infobox-data"><span class="url"><a rel="nofollow" class="external text" href="https://github.com/ggml-org/llama.cpp">github<wbr>.com<wbr>/ggml-org<wbr>/llama<wbr>.cpp</a></span></td></tr></tbody></table> 
<p><b>llama.cpp</b> is an <a href="Open_source" title="Open source">open source</a> <a href="Software_library" class="mw-redirect" title="Software library">software library</a> that performs <a href="Inference_engine" title="Inference engine">inference</a> on various <a href="Large_language_model" title="Large language model">large language models</a> such as <a href="Llama_(language_model)" title="Llama (language model)">Llama</a>.<sup id="cite_ref-register-llamafile_3-0" class="reference"><a href="#cite_note-register-llamafile-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup> It is co-developed alongside the <style data-mw-deduplicate="TemplateStyles:r1038841319">
/* start https://en.wikipedia.org/ */


.mw-parser-output .tooltip-dotted{border-bottom:1px dotted;cursor:help}


/* end   https://en.wikipedia.org/ */
</style><span class="rt-commentedText tooltip tooltip-dotted" title="Georgi Gerganov Machine Learning">GGML</span> project, a general-purpose <a href="Tensor_(machine_learning)" title="Tensor (machine learning)">tensor</a> library.<sup id="cite_ref-ggml_4-0" class="reference"><a href="#cite_note-ggml-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup>
</p><p><a href="Command-line_interface" title="Command-line interface">Command-line tools</a> are included with the library,<sup id="cite_ref-theregister_14_Jul_2024_5-0" class="reference"><a href="#cite_note-theregister_14_Jul_2024-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup> alongside a <a href="Web_server" title="Web server">server</a> with a simple <a href="Web_application" title="Web application">web interface</a>.<sup id="cite_ref-lwn_6-0" class="reference"><a href="#cite_note-lwn-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-theregister_15_December_2024_7-0" class="reference"><a href="#cite_note-theregister_15_December_2024-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup>
</p>

<div class="mw-heading mw-heading2"><h2 id="Background">Background</h2></div>
<p>Towards the end of September 2022, Georgi Gerganov started work on the GGML library, a C library implementing <a href="Tensor_algebra" title="Tensor algebra">tensor algebra</a>. Gerganov developed the library with the intention of strict memory management and multi-threading. The creation of GGML was inspired by <a href="Fabrice_Bellard" title="Fabrice Bellard">Fabrice Bellard</a>'s work on LibNC.<sup id="cite_ref-changelog-podcast-mar-2023_8-0" class="reference"><a href="#cite_note-changelog-podcast-mar-2023-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup>
</p><p>Before llama.cpp, Gerganov worked on a similar library called whisper.cpp which implemented <a href="Whisper_(speech_recognition_system)" title="Whisper (speech recognition system)">Whisper</a>, a speech to text model by <a href="OpenAI" title="OpenAI">OpenAI</a>.<sup id="cite_ref-whisper_9-0" class="reference"><a href="#cite_note-whisper-9"><span class="cite-bracket">[</span>9<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Development">Development</h2></div>
<p>llama.cpp began development in March 2023 by Georgi Gerganov as an implementation of the <a href="Llama_(language_model)" title="Llama (language model)">Llama</a> inference code in pure C/C++ with no dependencies. This improved performance on computers without <a href="GPU" class="mw-redirect" title="GPU">GPU</a> or other dedicated hardware, which was a goal of the project.<sup id="cite_ref-register-llamafile_3-1" class="reference"><a href="#cite_note-register-llamafile-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-arstechnica_10-0" class="reference"><a href="#cite_note-arstechnica-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-Wiest_11-0" class="reference"><a href="#cite_note-Wiest-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup> llama.cpp gained traction with users who lacked specialized hardware, as it could run on just a <a href="CPU" class="mw-redirect" title="CPU">CPU</a>.
</p><p>While initially designed for CPUs, GPU and NPU backend support was later added.<sup id="cite_ref-Rajput_12-0" class="reference"><a href="#cite_note-Rajput-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup> As of August 2025 it has more than 85,000 stars on GitHub.<sup id="cite_ref-llama.cpprepo_13-0" class="reference"><a href="#cite_note-llama.cpprepo-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup>
</p><p>On Apr 30, 2024, <a href="Transformer_(deep_learning_architecture)#FlashAttention" class="mw-redirect" title="Transformer (deep learning architecture)">FlashAttention</a> was introduced.
</p><p>On Apr 10, 2025, libmtmd was introduced, which reinvigorated support for multimodal models that has been stagnant previously.
</p><p>On Dec 17, 2025, full acceleration on <a href="Android_(operating_system)" title="Android (operating system)">Android</a> and <a href="ChromeOS" title="ChromeOS">ChromeOS</a> devices was introduced via a new GUI binding<sup id="cite_ref-14" class="reference"><a href="#cite_note-14"><span class="cite-bracket">[</span>14<span class="cite-bracket">]</span></a></sup>, which unlocks native app development beyond the previous approach of cross-compiling and running CLI <sup id="cite_ref-arstechnica_10-1" class="reference"><a href="#cite_note-arstechnica-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-mozilla-introducing-llamafile_15-0" class="reference"><a href="#cite_note-mozilla-introducing-llamafile-15"><span class="cite-bracket">[</span>15<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-16" class="reference"><a href="#cite_note-16"><span class="cite-bracket">[</span>16<span class="cite-bracket">]</span></a></sup> in an <a rel="nofollow" class="external text" href="https://developer.android.com/tools/adb#shellcommands">adb shell</a>. 
</p>
<div class="mw-heading mw-heading2"><h2 id="Architecture">Architecture</h2></div>
<p>llama.cpp supports multiple hardware targets, including <a href="X86" title="X86">x86</a>, <a href="ARM_architecture_family" title="ARM architecture family">ARM</a>, <a href="Metal_(API)" title="Metal (API)">Metal</a>, <a href="BLAS" class="mw-redirect" title="BLAS">BLAS</a>, <a href="BLIS_(software)" title="BLIS (software)">BLIS</a>, <a rel="nofollow" class="external text" href="https://github.com/IBM/zDNN">zDNN</a>, <a rel="nofollow" class="external text" href="https://github.com/amd/ZenDNN">ZenDNN</a>, <a href="SYCL" title="SYCL">SYCL</a>, <a href="Moore_Threads" title="Moore Threads">MUSA</a>, <a href="CUDA" title="CUDA">CUDA</a>, <a href="ROCm" title="ROCm">HIP</a>, <a href="HiSilicon" title="HiSilicon">CANN</a>, <a href="OpenCL" title="OpenCL">OpenCL</a>, <a href="Remote_procedure_call" title="Remote procedure call">RPC</a> and <a href="Vulkan" title="Vulkan">Vulkan</a> (version 1.2 or greater).<sup id="cite_ref-Gerganov_Slaren_Nguyen_Introduction_to_ggml_17-0" class="reference"><a href="#cite_note-Gerganov_Slaren_Nguyen_Introduction_to_ggml-17"><span class="cite-bracket">[</span>17<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-Kluska_18-0" class="reference"><a href="#cite_note-Kluska-18"><span class="cite-bracket">[</span>18<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-Run_LLMs_on_Intel_GPUs_Using_llama.cpp_19-0" class="reference"><a href="#cite_note-Run_LLMs_on_Intel_GPUs_Using_llama.cpp-19"><span class="cite-bracket">[</span>19<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-Bolz_20-0" class="reference"><a href="#cite_note-Bolz-20"><span class="cite-bracket">[</span>20<span class="cite-bracket">]</span></a></sup> These back-ends make up the GGML tensor library which is used by the front-end model-specific llama.cpp code.<sup id="cite_ref-tomshardware_21-0" class="reference"><a href="#cite_note-tomshardware-21"><span class="cite-bracket">[</span>21<span class="cite-bracket">]</span></a></sup> llama.cpp makes use of several CPU extensions for optimization: 
</p>
<ul><li><a href="Advanced_Vector_Extensions" title="Advanced Vector Extensions">AVX</a>, <a href="AVX2" class="mw-redirect" title="AVX2">AVX2</a>, <a href="AVX-512" title="AVX-512">AVX-512</a>, <a href="AVX-VNNI" class="mw-redirect" title="AVX-VNNI">AVX-VNNI</a> and <a href="Advanced_Matrix_Extensions" title="Advanced Matrix Extensions">AMX</a> for <a href="X86-64" title="X86-64">X86-64</a>.</li>
<li><a href="ARM_architecture_family#Advanced_SIMD_(Neon)" title="ARM architecture family">Neon</a>, <a rel="nofollow" class="external text" href="https://developer.arm.com/community/arm-community-blogs/b/ai-blog/posts/optimize-llama-cpp-with-arm-i8mm-instruction">i8MM</a>, <a rel="nofollow" class="external text" href="https://developer.arm.com/documentation/102476/0101/Introducing-SVE">SVE</a>, <a rel="nofollow" class="external text" href="https://developer.arm.com/documentation/102340/0100/Introducing-SVE2">SVE2</a>, <a rel="nofollow" class="external text" href="https://developer.arm.com/documentation/109246/0101/SME-Overview/SME-and-SME2">SME and SME2</a> for <a href="AArch64" title="AArch64">AArch64</a> (ARM64).</li>
<li>VXE2 (Vector Enhancement Facility 2) for <a href="S390x" class="mw-redirect" title="S390x">S390x</a>.</li>
<li><a href="Apple_silicon" title="Apple silicon">Apple silicon</a> is an important target for the project.<sup id="cite_ref-llama.cpprepo_13-1" class="reference"><a href="#cite_note-llama.cpprepo-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-phoronix-llamafile_22-0" class="reference"><a href="#cite_note-phoronix-llamafile-22"><span class="cite-bracket">[</span>22<span class="cite-bracket">]</span></a></sup></li></ul>
<p>llama.cpp supports a variety of features aimed at inference on edge devices, such as:
</p>
<ul><li>Ahead of time model <a href="Quantization_(signal_processing)" title="Quantization (signal processing)">quantization</a> and on-the-fly kv-cache quantization.<sup id="cite_ref-Walkowiak_23-0" class="reference"><a href="#cite_note-Walkowiak-23"><span class="cite-bracket">[</span>23<span class="cite-bracket">]</span></a></sup></li>
<li><a href="Transformer_(deep_learning_architecture)#Speculative_decoding" class="mw-redirect" title="Transformer (deep learning architecture)">Speculative decoding</a>.<sup id="cite_ref-theregister_15_December_2024_7-1" class="reference"><a href="#cite_note-theregister_15_December_2024-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup></li>
<li>Partial offloading of model layers to system <a href="RAM" class="mw-redirect" title="RAM">RAM</a>, allowing devices to load models that would be too large to fit solely in <a href="GPU" class="mw-redirect" title="GPU">GPU</a> <a href="VRAM" class="mw-redirect" title="VRAM">VRAM</a>.</li></ul>
<p>In addition, llama.cpp supports a variety of features and <a href="API" title="API">APIs</a> for frontend communication, such as:
</p>
<ul><li>OpenAI-compatible endpoints like <code>v1/chat/completions</code>.</li>
<li>Grammar-based output formatting as <a href="JSON" title="JSON">JSON</a>.<sup id="cite_ref-Wiest_11-1" class="reference"><a href="#cite_note-Wiest-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup></li></ul>
<div class="mw-heading mw-heading2"><h2 id="GGUF_file_format">GGUF file format</h2></div>
<table class="infobox"><tbody><tr><th colspan="2" class="infobox-above" style="padding-bottom: 0.15em;background-color:#e0e0e0;color:inherit;">GGUF</th></tr><tr><td colspan="2" class="infobox-image"><span typeof="mw:File"><img src="./_assets_/0c70a452f799bfe840676ee341124611/GGML_logo.svg.png" decoding="async" width="64" height="64" class="mw-file-element" data-file-width="256" data-file-height="256" loading="lazy"></span></td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;"><a href="Filename_extension" title="Filename extension">Filename extension</a></th><td class="infobox-data" style="line-height: 1.35;"><code class="mw-highlight mw-highlight-lang-text mw-content-ltr" style="" dir="ltr">.gguf</code></td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;"><a href="File_format#Magic_number" title="File format">Magic number</a></th><td class="infobox-data" style="line-height: 1.35;"><code class="mw-highlight mw-highlight-lang-text mw-content-ltr" style="" dir="ltr">0x47</code> <code class="mw-highlight mw-highlight-lang-text mw-content-ltr" style="" dir="ltr">0x47</code> <code class="mw-highlight mw-highlight-lang-text mw-content-ltr" style="" dir="ltr">0x55</code> <code class="mw-highlight mw-highlight-lang-text mw-content-ltr" style="" dir="ltr">0x46</code></td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;">Developed&nbsp;by</th><td class="infobox-data" style="line-height: 1.35;">Georgi Gerganov and community</td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;">Initial release</th><td class="infobox-data" style="line-height: 1.35;">August&nbsp;22, 2023<span style="display:none">&nbsp;(<span class="bday dtstart published updated">2023-08-22</span>)</span><sup id="cite_ref-githubgguf_24-0" class="reference"><a href="#cite_note-githubgguf-24"><span class="cite-bracket">[</span>24<span class="cite-bracket">]</span></a></sup></td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;"><a href="Software_release_life_cycle" title="Software release life cycle">Latest release</a></th><td class="infobox-data" style="line-height: 1.35;"><div style="display: inline-block; line-height: 1.2em; padding: .1em 0;">v3<sup id="cite_ref-ggufdoc_25-0" class="reference"><a href="#cite_note-ggufdoc-25"><span class="cite-bracket">[</span>25<span class="cite-bracket">]</span></a></sup> </div></td></tr><tr><th scope="row" class="infobox-label" style="line-height: 1.2; padding-right: 0.65em;">Type of format</th><td class="infobox-data" style="line-height: 1.35;"><a href="Machine-learning" class="mw-redirect" title="Machine-learning">Machine-learning</a> <a href="Tensor_(machine_learning)" title="Tensor (machine learning)">tensors</a></td></tr></tbody></table>
<p>The GGUF (<span class="rt-commentedText tooltip tooltip-dotted" title="Georgi Gerganov Machine Learning">GGML</span> Universal File)<sup id="cite_ref-gguf-py_26-0" class="reference"><a href="#cite_note-gguf-py-26"><span class="cite-bracket">[</span>26<span class="cite-bracket">]</span></a></sup> file format is a binary format that stores both tensors and metadata in a single file, and is designed for fast saving, and loading of model data.<sup id="cite_ref-huggingface_27-0" class="reference"><a href="#cite_note-huggingface-27"><span class="cite-bracket">[</span>27<span class="cite-bracket">]</span></a></sup> It was introduced in August 2023 by the llama.cpp project to better maintain backwards compatibility as support was added for other model architectures.<sup id="cite_ref-Rajput_12-1" class="reference"><a href="#cite_note-Rajput-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-ibm-gguf-vs-ggml_28-0" class="reference"><a href="#cite_note-ibm-gguf-vs-ggml-28"><span class="cite-bracket">[</span>28<span class="cite-bracket">]</span></a></sup> It superseded previous formats used by the project such as GGML.
</p><p>GGUF files are typically created by converting models developed with a different machine learning library such as <a href="PyTorch" title="PyTorch">PyTorch</a>.<sup id="cite_ref-huggingface_27-1" class="reference"><a href="#cite_note-huggingface-27"><span class="cite-bracket">[</span>27<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Design">Design</h3></div>
<p>GGUF focuses on quantization, the act of reducing precision in the model weights. This can lead to reduced memory usage and increased speed, albeit at the cost of reduced model accuracy.<sup id="cite_ref-towardsdatascience_29-0" class="reference"><a href="#cite_note-towardsdatascience-29"><span class="cite-bracket">[</span>29<span class="cite-bracket">]</span></a></sup><sup id="cite_ref-ibm-gguf-vs-ggml_28-1" class="reference"><a href="#cite_note-ibm-gguf-vs-ggml-28"><span class="cite-bracket">[</span>28<span class="cite-bracket">]</span></a></sup>
</p><p>GGUF supports 2-bit to 8-bit quantized integer types,<sup id="cite_ref-Cabezas_30-0" class="reference"><a href="#cite_note-Cabezas-30"><span class="cite-bracket">[</span>30<span class="cite-bracket">]</span></a></sup> common floating-point data formats such as <a href="Float32" class="mw-redirect" title="Float32">float32</a>, <a href="Float16" class="mw-redirect" title="Float16">float16</a>, and <a href="Bfloat16" class="mw-redirect" title="Bfloat16">bfloat16</a>, and 1.58 bit quantization.<sup id="cite_ref-theregister_14_Jul_2024_5-1" class="reference"><a href="#cite_note-theregister_14_Jul_2024-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup>
</p><p>GGUF contains information necessary for running a GPT-like language model such as the tokenizer vocabulary, context length, tensor info and other attributes.<sup id="cite_ref-Accelerating_GGUF_Models_with_Transformers_31-0" class="reference"><a href="#cite_note-Accelerating_GGUF_Models_with_Transformers-31"><span class="cite-bracket">[</span>31<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Byte-level_structure_(little-endian)"><span id="Byte-level_structure_.28little-endian.29"></span>Byte-level structure (little-endian)</h3></div>
<table class="wikitable">
<tbody><tr>
<th>Bytes</th>
<th>Description<sup id="cite_ref-gguf.md_32-0" class="reference"><a href="#cite_note-gguf.md-32"><span class="cite-bracket">[</span>32<span class="cite-bracket">]</span></a></sup>
</th></tr>
<tr>
<td>4</td>
<td>GGUF magic number, currently set to <code>0x47 0x47 0x55 0x46</code>
</td></tr>
<tr>
<td>4</td>
<td>GGUF version, currently set to <code>3</code>
</td></tr>
<tr>
<td>8</td>
<td><code>UINT64 tensor_count</code>: number of tensors
</td></tr>
<tr>
<td>8</td>
<td><code>UINT64 metadata_kv_count</code>: number of metadata key-value pairs
</td></tr>
<tr>
<td>Variable</td>
<td>Metadata block, containing <i>metadata_kv_count</i> key-value pairs
</td></tr>
<tr>
<td>Variable</td>
<td>Tensors info block, containing <i>tensor_count</i> values
</td></tr>
<tr>
<td>Variable</td>
<td><code>uint8_t tensor_data[]</code>, weight bits block
</td></tr></tbody></table>
<div class="mw-heading mw-heading4"><h4 id="Metadata_block">Metadata block</h4></div>
<div class="mw-highlight mw-highlight-lang-php mw-content-ltr" dir="ltr"><pre><span></span><span class="c1">// example metadata</span>
<span class="nx">general</span><span class="o">.</span><span class="nx">architecture</span><span class="o">:</span>  <span class="s1">'llama'</span><span class="p">,</span>
<span class="nx">general</span><span class="o">.</span><span class="nx">name</span><span class="o">:</span>          <span class="s1">'LLaMA v2'</span><span class="p">,</span>
<span class="nx">llama</span><span class="o">.</span><span class="nx">context_length</span><span class="o">:</span>  <span class="mi">4096</span><span class="p">,</span>
<span class="o">...</span> <span class="p">,</span>
<span class="nx">general</span><span class="o">.</span><span class="nx">file_type</span><span class="o">:</span>     <span class="mi">10</span><span class="p">,</span> <span class="c1">// (typically indicates quantization level, here "MOSTLY_Q2_K")</span>
<span class="nx">tokenizer</span><span class="o">.</span><span class="nx">ggml</span><span class="o">.</span><span class="nx">model</span><span class="o">:</span> <span class="s1">'llama'</span><span class="p">,</span>
<span class="nx">tokenizer</span><span class="o">.</span><span class="nx">ggml</span><span class="o">.</span><span class="nx">tokens</span><span class="o">:</span> <span class="p">[</span>
   <span class="s1">'&lt;unk&gt;'</span><span class="p">,</span> <span class="s1">'&lt;s&gt;'</span><span class="p">,</span> <span class="s1">'&lt;/s&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x00&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x01&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x02&gt;'</span><span class="p">,</span>
   <span class="s1">'&lt;0x03&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x04&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x05&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x06&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x07&gt;'</span><span class="p">,</span> <span class="s1">'&lt;0x08&gt;'</span><span class="p">,</span>
   <span class="o">...</span>
<span class="p">],</span>
<span class="o">...</span>
</pre></div>
<div class="mw-heading mw-heading4"><h4 id="Tensors_info_block">Tensors info block</h4></div>
<div class="mw-highlight mw-highlight-lang-c mw-content-ltr" dir="ltr"><pre><span></span><span class="c1">// n-th tensor</span>
<span class="nl">name</span><span class="p">:</span><span class="w">         </span><span class="n">GGUF</span><span class="w"> </span><span class="n">string</span><span class="p">,</span><span class="w"> </span><span class="c1">// ex: "blk.0.ffn_gate.weight"</span>
<span class="nl">n_dimensions</span><span class="p">:</span><span class="w"> </span><span class="n">UINT32</span><span class="p">,</span><span class="w">      </span><span class="c1">// ex: 2</span>
<span class="nl">dimensions</span><span class="p">:</span><span class="w">   </span><span class="n">UINT64</span><span class="p">[],</span><span class="w">    </span><span class="c1">// ex: [ 4096, 32000 ]</span>
<span class="nl">type</span><span class="p">:</span><span class="w">         </span><span class="n">UINT32</span><span class="p">,</span><span class="w">      </span><span class="c1">// ex: 10 (typically indicates quantization level, here "GGML_TYPE_Q2_K")</span>
<span class="nl">offset</span><span class="p">:</span><span class="w">       </span><span class="n">UINT64</span><span class="w">       </span><span class="c1">// starting position within the tensor_data block, relative to the start of the block</span>
<span class="c1">// (n+1)-th tensor</span>
<span class="p">...</span>
</pre></div>
<div class="mw-heading mw-heading2"><h2 id="References">References</h2></div>
<style data-mw-deduplicate="TemplateStyles:r1327269900">
/* start https://en.wikipedia.org/ */


.mw-parser-output .reflist-columns-2{column-width:30em}.mw-parser-output .reflist-columns-3{column-width:25em}body.skin-vector-2022 .mw-parser-output .reflist-columns-2{column-width:27em}body.skin-vector-2022 .mw-parser-output .reflist-columns-3{column-width:22.5em}.mw-parser-output .references[data-mw-group=upper-alpha]{list-style-type:upper-alpha}.mw-parser-output .references[data-mw-group=upper-roman]{list-style-type:upper-roman}.mw-parser-output .references[data-mw-group=lower-alpha]{list-style-type:lower-alpha}.mw-parser-output .references[data-mw-group=lower-greek]{list-style-type:lower-greek}.mw-parser-output .references[data-mw-group=lower-roman]{list-style-type:lower-roman}.mw-parser-output div.reflist-liststyle-upper-alpha .references{list-style-type:upper-alpha}.mw-parser-output div.reflist-liststyle-upper-roman .references{list-style-type:upper-roman}.mw-parser-output div.reflist-liststyle-lower-alpha .references{list-style-type:lower-alpha}.mw-parser-output div.reflist-liststyle-lower-greek .references{list-style-type:lower-greek}.mw-parser-output div.reflist-liststyle-lower-roman .references{list-style-type:lower-roman}


/* end   https://en.wikipedia.org/ */
</style><div>
<div class="mw-references-wrap mw-references-columns"><ol class="references">
<li id="cite_note-githubrelease-1"><span class="mw-cite-backlink"><b><a href="#cite_ref-githubrelease_1-0">^</a></b></span> <span class="reference-text"><style data-mw-deduplicate="TemplateStyles:r1333433106">
/* start https://en.wikipedia.org/ */


.mw-parser-output cite.citation{font-style:inherit;word-wrap:break-word}.mw-parser-output .citation q{quotes:"\"""\"""'""'"}.mw-parser-output .citation:target{background-color:rgba(0,127,255,0.133)}.mw-parser-output .id-lock-free.id-lock-free a{background:url("./_mw_/Lock-green.svg")right 0.1em center/9px no-repeat}.mw-parser-output .id-lock-limited.id-lock-limited a,.mw-parser-output .id-lock-registration.id-lock-registration a{background:url("./_mw_/Lock-gray-alt-2.svg")right 0.1em center/9px no-repeat}.mw-parser-output .id-lock-subscription.id-lock-subscription a{background:url("./_mw_/Lock-red-alt-2.svg")right 0.1em center/9px no-repeat}.mw-parser-output .cs1-ws-icon a{background:url("./_mw_/Wikisource-logo.svg")right 0.1em center/12px no-repeat}body:not(.skin-timeless):not(.skin-minerva) .mw-parser-output .id-lock-free a,body:not(.skin-timeless):not(.skin-minerva) .mw-parser-output .id-lock-limited a,body:not(.skin-timeless):not(.skin-minerva) .mw-parser-output .id-lock-registration a,body:not(.skin-timeless):not(.skin-minerva) .mw-parser-output .id-lock-subscription a,body:not(.skin-timeless):not(.skin-minerva) .mw-parser-output .cs1-ws-icon a{background-size:contain;padding:0 1em 0 0}.mw-parser-output .cs1-code{color:inherit;background:inherit;border:none;padding:inherit}.mw-parser-output .cs1-hidden-error{display:none;color:var(--color-error,#bf3c2c)}.mw-parser-output .cs1-visible-error{color:var(--color-error,#bf3c2c)}.mw-parser-output .cs1-maint{display:none;color:#085;margin-left:0.3em}.mw-parser-output .cs1-kern-left{padding-left:0.2em}.mw-parser-output .cs1-kern-right{padding-right:0.2em}.mw-parser-output .citation .mw-selflink{font-weight:inherit}@media screen{.mw-parser-output .cs1-format{font-size:95%}html.skin-theme-clientpref-night .mw-parser-output .cs1-maint{color:#18911f}}@media screen and (prefers-color-scheme:dark){html.skin-theme-clientpref-os .mw-parser-output .cs1-maint{color:#18911f}}


/* end   https://en.wikipedia.org/ */
</style><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/llama.cpp/commit/26c084662903ddaca19bef982831bfb0856e8257">"Initial release · ggerganov/llama.cpp@26c0846"</a>. <i>GitHub</i><span class="reference-accessdate">. Retrieved <span class="nowrap">15 May</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=Initial+release+%C2%B7+ggerganov%2Fllama.cpp%4026c0846&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fllama.cpp%2Fcommit%2F26c084662903ddaca19bef982831bfb0856e8257&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-license-2"><span class="mw-cite-backlink"><b><a href="#cite_ref-license_2-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/llama.cpp/blob/master/LICENSE">"llama.cpp/LICENSE at master · ggerganov/llama.cpp"</a>. <i>GitHub</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=llama.cpp%2FLICENSE+at+master+%C2%B7+ggerganov%2Fllama.cpp&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fllama.cpp%2Fblob%2Fmaster%2FLICENSE&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-register-llamafile-3"><span class="mw-cite-backlink">^ <a href="#cite_ref-register-llamafile_3-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-register-llamafile_3-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFConnatser" class="citation web cs1">Connatser, Matthew. <a rel="nofollow" class="external text" href="https://www.theregister.com/2024/04/03/llamafile_performance_gains/">"How this open source LLM chatbot runner hit the gas on x86, Arm CPUs"</a>. <i>theregister.com</i><span class="reference-accessdate">. Retrieved <span class="nowrap">15 April</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=theregister.com&amp;rft.atitle=How+this+open+source+LLM+chatbot+runner+hit+the+gas+on+x86%2C+Arm+CPUs&amp;rft.aulast=Connatser&amp;rft.aufirst=Matthew&amp;rft_id=https%3A%2F%2Fwww.theregister.com%2F2024%2F04%2F03%2Fllamafile_performance_gains%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-ggml-4"><span class="mw-cite-backlink"><b><a href="#cite_ref-ggml_4-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFGerganov2024" class="citation web cs1">Gerganov, Georgi (17 May 2024). <a rel="nofollow" class="external text" href="https://github.com/ggerganov/ggml">"ggerganov/ggml"</a>. <i><a href="GitHub" title="GitHub">GitHub</a></i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=ggerganov%2Fggml&amp;rft.date=2024-05-17&amp;rft.aulast=Gerganov&amp;rft.aufirst=Georgi&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fggml&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-theregister_14_Jul_2024-5"><span class="mw-cite-backlink">^ <a href="#cite_ref-theregister_14_Jul_2024_5-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-theregister_14_Jul_2024_5-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFMann2024" class="citation web cs1">Mann, Tobias (14 Jul 2024). <a rel="nofollow" class="external text" href="https://www.theregister.com/2024/07/14/quantization_llm_feature/">"Honey, I shrunk the LLM! A beginner's guide to quantization – and testing it"</a>. <i>theregister</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=theregister&amp;rft.atitle=Honey%2C+I+shrunk+the+LLM%21+A+beginner%27s+guide+to+quantization+%E2%80%93+and+testing+it&amp;rft.date=2024-07-14&amp;rft.aulast=Mann&amp;rft.aufirst=Tobias&amp;rft_id=https%3A%2F%2Fwww.theregister.com%2F2024%2F07%2F14%2Fquantization_llm_feature%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-lwn-6"><span class="mw-cite-backlink"><b><a href="#cite_ref-lwn_6-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFAlden" class="citation web cs1">Alden, Daroc. <a rel="nofollow" class="external text" href="https://lwn.net/Articles/971195/">"Portable LLMs with llamafile [LWN.net]"</a>. <i>lwn.net</i><span class="reference-accessdate">. Retrieved <span class="nowrap">30 July</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=lwn.net&amp;rft.atitle=Portable+LLMs+with+llamafile+%5BLWN.net%5D&amp;rft.aulast=Alden&amp;rft.aufirst=Daroc&amp;rft_id=https%3A%2F%2Flwn.net%2FArticles%2F971195%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-theregister_15_December_2024-7"><span class="mw-cite-backlink">^ <a href="#cite_ref-theregister_15_December_2024_7-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-theregister_15_December_2024_7-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFMann2024" class="citation web cs1">Mann, Tobias (15 December 2024). <a rel="nofollow" class="external text" href="https://www.theregister.com/2024/12/15/speculative_decoding/">"Intro to speculative decoding: Cheat codes for faster LLMs"</a>. <i>theregister</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=theregister&amp;rft.atitle=Intro+to+speculative+decoding%3A+Cheat+codes+for+faster+LLMs&amp;rft.date=2024-12-15&amp;rft.aulast=Mann&amp;rft.aufirst=Tobias&amp;rft_id=https%3A%2F%2Fwww.theregister.com%2F2024%2F12%2F15%2Fspeculative_decoding%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-changelog-podcast-mar-2023-8"><span class="mw-cite-backlink"><b><a href="#cite_ref-changelog-podcast-mar-2023_8-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://changelog.com/podcast/532">"Bringing Whisper and LLaMA to the masses with Georgi Gerganov (Changelog Interviews #532)"</a>. <i>Changelog</i>. 22 March 2023<span class="reference-accessdate">. Retrieved <span class="nowrap">28 July</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=Changelog&amp;rft.atitle=Bringing+Whisper+and+LLaMA+to+the+masses+with+Georgi+Gerganov+%28Changelog+Interviews+%23532%29&amp;rft.date=2023-03-22&amp;rft_id=https%3A%2F%2Fchangelog.com%2Fpodcast%2F532&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-whisper-9"><span class="mw-cite-backlink"><b><a href="#cite_ref-whisper_9-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/whisper.cpp">"ggerganov/whisper.cpp"</a>. <i><a href="GitHub" title="GitHub">GitHub</a></i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=ggerganov%2Fwhisper.cpp&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fwhisper.cpp&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-arstechnica-10"><span class="mw-cite-backlink">^ <a href="#cite_ref-arstechnica_10-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-arstechnica_10-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFEdwards2023" class="citation web cs1">Edwards, Benj (13 March 2023). <a rel="nofollow" class="external text" href="https://arstechnica.com/information-technology/2023/03/you-can-now-run-a-gpt-3-level-ai-model-on-your-laptop-phone-and-raspberry-pi/">"You can now run a GPT-3-level AI model on your laptop, phone, and Raspberry Pi"</a>. <i>arstechnica.com</i><span class="reference-accessdate">. Retrieved <span class="nowrap">15 April</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=arstechnica.com&amp;rft.atitle=You+can+now+run+a+GPT-3-level+AI+model+on+your+laptop%2C+phone%2C+and+Raspberry+Pi&amp;rft.date=2023-03-13&amp;rft.aulast=Edwards&amp;rft.aufirst=Benj&amp;rft_id=https%3A%2F%2Farstechnica.com%2Finformation-technology%2F2023%2F03%2Fyou-can-now-run-a-gpt-3-level-ai-model-on-your-laptop-phone-and-raspberry-pi%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Wiest-11"><span class="mw-cite-backlink">^ <a href="#cite_ref-Wiest_11-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-Wiest_11-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFWiestFerberZhuvan_Treeck2024" class="citation journal cs1">Wiest, Isabella Catharina; Ferber, Dyke; Zhu, Jiefu; van Treeck, Marko; Meyer, Meyer, Sonja K.; Juglan, Radhika; Carrero, Zunamys I.; Paech, Daniel; Kleesiek, Jens; Ebert, Matthias P.; Truhn, Daniel; Kather, Jakob Nikolas (2024). <a rel="nofollow" class="external text" href="https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11415382">"Privacy-preserving large language models for structured medical information retrieval"</a>. <i>npj Digital Medicine</i>. <b>7</b> (257): 257. <a href="Doi_(identifier)" class="mw-redirect" title="Doi (identifier)">doi</a>:<a rel="nofollow" class="external text" href="https://doi.org/10.1038%2Fs41746-024-01233-2">10.1038/s41746-024-01233-2</a>. <a href="PMC_(identifier)" class="mw-redirect" title="PMC (identifier)">PMC</a>&nbsp;<span class="id-lock-free" title="Freely accessible"><a rel="nofollow" class="external text" href="https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11415382">11415382</a></span>. <a href="PMID_(identifier)" class="mw-redirect" title="PMID (identifier)">PMID</a>&nbsp;<a rel="nofollow" class="external text" href="https://pubmed.ncbi.nlm.nih.gov/39304709">39304709</a>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=article&amp;rft.jtitle=npj+Digital+Medicine&amp;rft.atitle=Privacy-preserving+large+language+models+for+structured+medical+information+retrieval&amp;rft.volume=7&amp;rft.issue=257&amp;rft.pages=257&amp;rft.date=2024&amp;rft_id=https%3A%2F%2Fwww.ncbi.nlm.nih.gov%2Fpmc%2Farticles%2FPMC11415382%23id-name%3DPMC&amp;rft_id=info%3Apmid%2F39304709&amp;rft_id=info%3Adoi%2F10.1038%2Fs41746-024-01233-2&amp;rft.aulast=Wiest&amp;rft.aufirst=Isabella+Catharina&amp;rft.au=Ferber%2C+Dyke&amp;rft.au=Zhu%2C+Jiefu&amp;rft.au=van+Treeck%2C+Marko&amp;rft.au=Meyer%2C+Meyer%2C+Sonja+K.&amp;rft.au=Juglan%2C+Radhika&amp;rft.au=Carrero%2C+Zunamys+I.&amp;rft.au=Paech%2C+Daniel&amp;rft.au=Kleesiek%2C+Jens&amp;rft.au=Ebert%2C+Matthias+P.&amp;rft.au=Truhn%2C+Daniel&amp;rft.au=Kather%2C+Jakob+Nikolas&amp;rft_id=https%3A%2F%2Fwww.ncbi.nlm.nih.gov%2Fpmc%2Farticles%2FPMC11415382&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span><span class="cs1-maint citation-comment"><code class="cs1-code">{{cite journal}}</code>:  CS1 maint: multiple names: authors list (link)</span></span>
</li>
<li id="cite_note-Rajput-12"><span class="mw-cite-backlink">^ <a href="#cite_ref-Rajput_12-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-Rajput_12-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFRajputSharma2024" class="citation book cs1">Rajput, Saurabhsingh; Sharma, Tushar (4 June 2024). "Benchmarking Emerging Deep Learning Quantization Methods for Energy Efficiency". <i>2024 IEEE 21st International Conference on Software Architecture Companion (ICSA-C)</i>. pp.&nbsp;<span class="nowrap">238–</span>242. <a href="Doi_(identifier)" class="mw-redirect" title="Doi (identifier)">doi</a>:<a rel="nofollow" class="external text" href="https://doi.org/10.1109%2FICSA-C63560.2024.00049">10.1109/ICSA-C63560.2024.00049</a>. <a href="ISBN_(identifier)" class="mw-redirect" title="ISBN (identifier)">ISBN</a>&nbsp;<bdi>979-8-3503-6625-9</bdi>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rft.genre=bookitem&amp;rft.atitle=Benchmarking+Emerging+Deep+Learning+Quantization+Methods+for+Energy+Efficiency&amp;rft.btitle=2024+IEEE+21st+International+Conference+on+Software+Architecture+Companion+%28ICSA-C%29&amp;rft.pages=238-242&amp;rft.date=2024-06-04&amp;rft_id=info%3Adoi%2F10.1109%2FICSA-C63560.2024.00049&amp;rft.isbn=979-8-3503-6625-9&amp;rft.aulast=Rajput&amp;rft.aufirst=Saurabhsingh&amp;rft.au=Sharma%2C+Tushar&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-llama.cpprepo-13"><span class="mw-cite-backlink">^ <a href="#cite_ref-llama.cpprepo_13-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-llama.cpprepo_13-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/llama.cpp">"ggerganov/llama.cpp"</a>. <i><a href="GitHub" title="GitHub">GitHub</a></i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=ggerganov%2Fllama.cpp&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fllama.cpp&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-14"><span class="mw-cite-backlink"><b><a href="#cite_ref-14">^</a></b></span> <span class="reference-text"><cite id="CITEREFggml-org" class="citation web cs1">ggml-org. <a rel="nofollow" class="external text" href="https://github.com/ggml-org/llama.cpp/blob/master/docs/android.md">"llama.cpp/docs/android.md at master · ggml-org/llama.cpp"</a>. <i>GitHub</i><span class="reference-accessdate">. Retrieved <span class="nowrap">2025-12-20</span></span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=llama.cpp%2Fdocs%2Fandroid.md+at+master+%C2%B7+ggml-org%2Fllama.cpp&amp;rft.au=ggml-org&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggml-org%2Fllama.cpp%2Fblob%2Fmaster%2Fdocs%2Fandroid.md&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-mozilla-introducing-llamafile-15"><span class="mw-cite-backlink"><b><a href="#cite_ref-mozilla-introducing-llamafile_15-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFHood" class="citation web cs1">Hood, Stephen. <a rel="nofollow" class="external text" href="https://future.mozilla.org/builders/news_insights/introducing-llamafile/">"llamafile: bringing LLMs to the people, and to your own computer"</a>. <i>Mozilla Innovations</i><span class="reference-accessdate">. Retrieved <span class="nowrap">28 July</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=Mozilla+Innovations&amp;rft.atitle=llamafile%3A+bringing+LLMs+to+the+people%2C+and+to+your+own+computer&amp;rft.aulast=Hood&amp;rft.aufirst=Stephen&amp;rft_id=https%3A%2F%2Ffuture.mozilla.org%2Fbuilders%2Fnews_insights%2Fintroducing-llamafile%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-16"><span class="mw-cite-backlink"><b><a href="#cite_ref-16">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://lwn.net/Articles/931853/">"Democratizing AI with open-source language models"</a>. <i>lwn.net</i><span class="reference-accessdate">. Retrieved <span class="nowrap">28 July</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=lwn.net&amp;rft.atitle=Democratizing+AI+with+open-source+language+models&amp;rft_id=https%3A%2F%2Flwn.net%2FArticles%2F931853%2F&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Gerganov_Slaren_Nguyen_Introduction_to_ggml-17"><span class="mw-cite-backlink"><b><a href="#cite_ref-Gerganov_Slaren_Nguyen_Introduction_to_ggml_17-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFGerganovNguyenSlaren2024" class="citation web cs1">Gerganov, Georgi; Nguyen, Xuan Son; Slaren (August 13, 2024). <a rel="nofollow" class="external text" href="https://huggingface.co/blog/introduction-to-ggml">"Introduction to ggml"</a>. <i>Huggingface</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=Huggingface&amp;rft.atitle=Introduction+to+ggml&amp;rft.date=2024-08-13&amp;rft.aulast=Gerganov&amp;rft.aufirst=Georgi&amp;rft.au=Nguyen%2C+Xuan+Son&amp;rft.au=Slaren&amp;rft_id=https%3A%2F%2Fhuggingface.co%2Fblog%2Fintroduction-to-ggml&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Kluska-18"><span class="mw-cite-backlink"><b><a href="#cite_ref-Kluska_18-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFKluskaCastell´oScheideggerI._Malossi2024" class="citation journal cs1">Kluska, Piotr; Castell´o, Adri´an; Scheidegger, Florian; I. Malossi, A. Cristiano; Quintana-Ort´ı, Enrique (June 2024). <a rel="nofollow" class="external text" href="https://openaccess.thecvf.com/content/CVPR2024W/ELVM/papers/Kluska_QAttn_Efficient_GPU_Kernels_for_Mixed-precision_Vision_Transformers_CVPRW_2024_paper.pdf">"QAttn: Efficient GPU Kernels for mixed-precision Vision Transformers"</a> <span class="cs1-format">(PDF)</span>. <i>Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=article&amp;rft.jtitle=Proceedings+of+the+IEEE%2FCVF+Conference+on+Computer+Vision+and+Pattern+Recognition+%28CVPR%29+Workshops&amp;rft.atitle=QAttn%3A+Efficient+GPU+Kernels+for+mixed-precision+Vision+Transformers&amp;rft.date=2024-06&amp;rft.aulast=Kluska&amp;rft.aufirst=Piotr&amp;rft.au=Castell%C2%B4o%2C+Adri%C2%B4an&amp;rft.au=Scheidegger%2C+Florian&amp;rft.au=I.+Malossi%2C+A.+Cristiano&amp;rft.au=Quintana-Ort%C2%B4%C4%B1%2C+Enrique&amp;rft_id=https%3A%2F%2Fopenaccess.thecvf.com%2Fcontent%2FCVPR2024W%2FELVM%2Fpapers%2FKluska_QAttn_Efficient_GPU_Kernels_for_Mixed-precision_Vision_Transformers_CVPRW_2024_paper.pdf&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Run_LLMs_on_Intel_GPUs_Using_llama.cpp-19"><span class="mw-cite-backlink"><b><a href="#cite_ref-Run_LLMs_on_Intel_GPUs_Using_llama.cpp_19-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFJianyuHengyuYingYu2024" class="citation magazine cs1">Jianyu, Zhang; Hengyu, Meng; Ying, Hu; Yu, Luo; Xiaoping, Duan; Corporation, Majumder Abhilash Intel (July 2024). <a rel="nofollow" class="external text" href="https://www.intel.com/content/www/us/en/developer/articles/technical/run-llms-on-gpus-using-llama-cpp.html">"Run LLMs on Intel GPUs Using llama.cpp"</a>. <i>The Parallel Universe</i>. No.&nbsp;57. Intel. pp.&nbsp;<span class="nowrap">34–</span>37.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=article&amp;rft.jtitle=The+Parallel+Universe&amp;rft.atitle=Run+LLMs+on+Intel+GPUs+Using+llama.cpp&amp;rft.issue=57&amp;rft.pages=34-37&amp;rft.date=2024-07&amp;rft.aulast=Jianyu&amp;rft.aufirst=Zhang&amp;rft.au=Hengyu%2C+Meng&amp;rft.au=Ying%2C+Hu&amp;rft.au=Yu%2C+Luo&amp;rft.au=Xiaoping%2C+Duan&amp;rft.au=Corporation%2C+Majumder+Abhilash+Intel&amp;rft_id=https%3A%2F%2Fwww.intel.com%2Fcontent%2Fwww%2Fus%2Fen%2Fdeveloper%2Farticles%2Ftechnical%2Frun-llms-on-gpus-using-llama-cpp.html&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Bolz-20"><span class="mw-cite-backlink"><b><a href="#cite_ref-Bolz_20-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFBolz2025" class="citation web cs1">Bolz, Jeff (February 11–13, 2025). <a rel="nofollow" class="external text" href="https://vulkan.org/user/pages/09.events/vulkanised-2025/T47-Jeff-Bolz-NVIDIA.pdf">"Machine Learning in Vulkan with Cooperative Matrix 2"</a> <span class="cs1-format">(PDF)</span>. Cambridge, UK: The Khronos Group/Nvidia.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rft.genre=unknown&amp;rft.btitle=Machine+Learning+in+Vulkan+with+Cooperative+Matrix+2&amp;rft.place=Cambridge%2C+UK&amp;rft.pub=The+Khronos+Group%2FNvidia&amp;rft.date=2025-02-11%2F2025-02-13&amp;rft.aulast=Bolz&amp;rft.aufirst=Jeff&amp;rft_id=https%3A%2F%2Fvulkan.org%2Fuser%2Fpages%2F09.events%2Fvulkanised-2025%2FT47-Jeff-Bolz-NVIDIA.pdf&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-tomshardware-21"><span class="mw-cite-backlink"><b><a href="#cite_ref-tomshardware_21-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFPounder2023" class="citation web cs1">Pounder, Les (25 March 2023). <a rel="nofollow" class="external text" href="https://www.tomshardware.com/how-to/create-ai-chatbot-server-on-raspberry-pi">"How To Create Your Own AI Chatbot Server With Raspberry Pi 4"</a>. <i>tomshardware.com</i><span class="reference-accessdate">. Retrieved <span class="nowrap">16 April</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=tomshardware.com&amp;rft.atitle=How+To+Create+Your+Own+AI+Chatbot+Server+With+Raspberry+Pi+4&amp;rft.date=2023-03-25&amp;rft.aulast=Pounder&amp;rft.aufirst=Les&amp;rft_id=https%3A%2F%2Fwww.tomshardware.com%2Fhow-to%2Fcreate-ai-chatbot-server-on-raspberry-pi&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-phoronix-llamafile-22"><span class="mw-cite-backlink"><b><a href="#cite_ref-phoronix-llamafile_22-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFLarabel" class="citation web cs1">Larabel, Michael. <a rel="nofollow" class="external text" href="https://www.phoronix.com/news/Llamafile-0.7">"Llamafile 0.7 Brings AVX-512 Support: 10x Faster Prompt Eval Times For AMD Zen 4"</a>. <i>www.phoronix.com</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=www.phoronix.com&amp;rft.atitle=Llamafile+0.7+Brings+AVX-512+Support%3A+10x+Faster+Prompt+Eval+Times+For+AMD+Zen+4&amp;rft.aulast=Larabel&amp;rft.aufirst=Michael&amp;rft_id=https%3A%2F%2Fwww.phoronix.com%2Fnews%2FLlamafile-0.7&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Walkowiak-23"><span class="mw-cite-backlink"><b><a href="#cite_ref-Walkowiak_23-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFWalkowiakWalkowiak2024" class="citation journal cs1">Walkowiak, Bartosz; Walkowiak, Tomasz (2024). <a rel="nofollow" class="external text" href="https://journals.pan.pl/Content/130704/18_4466_Walkowiak_L_sk.pdf">"Implementation of language models within an infrastructure designed for Natural Language Processing"</a> <span class="cs1-format">(PDF)</span>. <i>International Journal of Electronics and Telecommunications</i>. <b>70</b> (1): <span class="nowrap">153–</span>159. <a href="Doi_(identifier)" class="mw-redirect" title="Doi (identifier)">doi</a>:<a rel="nofollow" class="external text" href="https://doi.org/10.24425%2Fijet.2024.149525">10.24425/ijet.2024.149525</a><span class="reference-accessdate">. Retrieved <span class="nowrap">8 May</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=article&amp;rft.jtitle=International+Journal+of+Electronics+and+Telecommunications&amp;rft.atitle=Implementation+of+language+models+within+an+infrastructure+designed+for+Natural+Language+Processing&amp;rft.volume=70&amp;rft.issue=1&amp;rft.pages=153-159&amp;rft.date=2024&amp;rft_id=info%3Adoi%2F10.24425%2Fijet.2024.149525&amp;rft.aulast=Walkowiak&amp;rft.aufirst=Bartosz&amp;rft.au=Walkowiak%2C+Tomasz&amp;rft_id=https%3A%2F%2Fjournals.pan.pl%2FContent%2F130704%2F18_4466_Walkowiak_L_sk.pdf&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-githubgguf-24"><span class="mw-cite-backlink"><b><a href="#cite_ref-githubgguf_24-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/llama.cpp/pull/2398">"GGUF by ggerganov · Pull Request #2398 · ggerganov/llama.cpp"</a>. <i>GitHub</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=GGUF+by+ggerganov+%C2%B7+Pull+Request+%232398+%C2%B7+ggerganov%2Fllama.cpp&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fllama.cpp%2Fpull%2F2398&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-ggufdoc-25"><span class="mw-cite-backlink"><b><a href="#cite_ref-ggufdoc_25-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/ggml/blob/master/docs/gguf.md">"ggml/docs/gguf.md at master · ggerganov/ggml"</a>. <i>GitHub</i>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=ggml%2Fdocs%2Fgguf.md+at+master+%C2%B7+ggerganov%2Fggml&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fggml%2Fblob%2Fmaster%2Fdocs%2Fgguf.md&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-gguf-py-26"><span class="mw-cite-backlink"><b><a href="#cite_ref-gguf-py_26-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggerganov/llama.cpp/blob/master/gguf-py/README.md">"ggerganov/llama.cpp/gguf-py/README.md"</a>. <i>GitHub</i><span class="reference-accessdate">. Retrieved <span class="nowrap">10 November</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=GitHub&amp;rft.atitle=ggerganov%2Fllama.cpp%2Fgguf-py%2FREADME.md&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggerganov%2Fllama.cpp%2Fblob%2Fmaster%2Fgguf-py%2FREADME.md&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-huggingface-27"><span class="mw-cite-backlink">^ <a href="#cite_ref-huggingface_27-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-huggingface_27-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://huggingface.co/docs/hub/gguf">"GGUF"</a>. <i>huggingface.co</i><span class="reference-accessdate">. Retrieved <span class="nowrap">9 May</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=huggingface.co&amp;rft.atitle=GGUF&amp;rft_id=https%3A%2F%2Fhuggingface.co%2Fdocs%2Fhub%2Fgguf&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-ibm-gguf-vs-ggml-28"><span class="mw-cite-backlink">^ <a href="#cite_ref-ibm-gguf-vs-ggml_28-0"><sup><i><b>a</b></i></sup></a> <a href="#cite_ref-ibm-gguf-vs-ggml_28-1"><sup><i><b>b</b></i></sup></a></span> <span class="reference-text"><cite id="CITEREFMucci2024" class="citation web cs1">Mucci, Tim (3 July 2024). <a rel="nofollow" class="external text" href="https://www.ibm.com/think/topics/gguf-versus-ggml">"GGUF versus GGML"</a>. <i>www.ibm.com</i><span class="reference-accessdate">. Retrieved <span class="nowrap">26 July</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=www.ibm.com&amp;rft.atitle=GGUF+versus+GGML&amp;rft.date=2024-07-03&amp;rft.aulast=Mucci&amp;rft.aufirst=Tim&amp;rft_id=https%3A%2F%2Fwww.ibm.com%2Fthink%2Ftopics%2Fgguf-versus-ggml&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-towardsdatascience-29"><span class="mw-cite-backlink"><b><a href="#cite_ref-towardsdatascience_29-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFLabonne2023" class="citation web cs1">Labonne, Maxime (29 November 2023). <a rel="nofollow" class="external text" href="https://towardsdatascience.com/quantize-llama-models-with-ggml-and-llama-cpp-3612dfbcc172">"Quantize Llama models with GGUF and llama.cpp"</a>. <i>Medium</i>. Towards Data Science<span class="reference-accessdate">. Retrieved <span class="nowrap">9 May</span> 2024</span>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=unknown&amp;rft.jtitle=Medium&amp;rft.atitle=Quantize+Llama+models+with+GGUF+and+llama.cpp&amp;rft.date=2023-11-29&amp;rft.aulast=Labonne&amp;rft.aufirst=Maxime&amp;rft_id=https%3A%2F%2Ftowardsdatascience.com%2Fquantize-llama-models-with-ggml-and-llama-cpp-3612dfbcc172&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Cabezas-30"><span class="mw-cite-backlink"><b><a href="#cite_ref-Cabezas_30-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFCabezasFonseca-DelgadoReyes-ChacónVizcaino-Imacaña2024" class="citation book cs1">Cabezas, Darío; Fonseca-Delgado, Rigoberto; Reyes-Chacón, Iván; Vizcaino-Imacaña, Paulina; Morocho-Cayamcela, Manuel (2024). "Integrating a LLaMa-based Chatbot with Augmented Retrieval Generation as a Complementary Educational Tool for High School and College Students". <i>Proceedings of the 19th International Conference on Software Technologies</i>. pp.&nbsp;<span class="nowrap">395–</span>402. <a href="Doi_(identifier)" class="mw-redirect" title="Doi (identifier)">doi</a>:<a rel="nofollow" class="external text" href="https://doi.org/10.5220%2F0012763000003753">10.5220/0012763000003753</a>. <a href="ISBN_(identifier)" class="mw-redirect" title="ISBN (identifier)">ISBN</a>&nbsp;<bdi>978-989-758-706-1</bdi>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rft.genre=bookitem&amp;rft.atitle=Integrating+a+LLaMa-based+Chatbot+with+Augmented+Retrieval+Generation+as+a+Complementary+Educational+Tool+for+High+School+and+College+Students&amp;rft.btitle=Proceedings+of+the+19th+International+Conference+on+Software+Technologies&amp;rft.pages=395-402&amp;rft.date=2024&amp;rft_id=info%3Adoi%2F10.5220%2F0012763000003753&amp;rft.isbn=978-989-758-706-1&amp;rft.aulast=Cabezas&amp;rft.aufirst=Dar%C3%ADo&amp;rft.au=Fonseca-Delgado%2C+Rigoberto&amp;rft.au=Reyes-Chac%C3%B3n%2C+Iv%C3%A1n&amp;rft.au=Vizcaino-Imaca%C3%B1a%2C+Paulina&amp;rft.au=Morocho-Cayamcela%2C+Manuel&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-Accelerating_GGUF_Models_with_Transformers-31"><span class="mw-cite-backlink"><b><a href="#cite_ref-Accelerating_GGUF_Models_with_Transformers_31-0">^</a></b></span> <span class="reference-text"><cite id="CITEREFDongLinYuXu2024" class="citation magazine cs1">Dong, Bo; Lin, Jun; Yu, Zhentao; Xu, Zhenzhong; Luo, Yu; Chang, Hanwen; Shen, Haihao (July 2024). <a rel="nofollow" class="external text" href="https://www.intel.com/content/www/us/en/developer/articles/technical/accelerate-gguf-models-with-transformers.html">"Accelerating GGUF Models with Transformers"</a>. <i>The Parallel Universe</i>. No.&nbsp;57. Intel. pp.&nbsp;<span class="nowrap">28–</span>33.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Ajournal&amp;rft.genre=article&amp;rft.jtitle=The+Parallel+Universe&amp;rft.atitle=Accelerating+GGUF+Models+with+Transformers&amp;rft.issue=57&amp;rft.pages=28-33&amp;rft.date=2024-07&amp;rft.aulast=Dong&amp;rft.aufirst=Bo&amp;rft.au=Lin%2C+Jun&amp;rft.au=Yu%2C+Zhentao&amp;rft.au=Xu%2C+Zhenzhong&amp;rft.au=Luo%2C+Yu&amp;rft.au=Chang%2C+Hanwen&amp;rft.au=Shen%2C+Haihao&amp;rft_id=https%3A%2F%2Fwww.intel.com%2Fcontent%2Fwww%2Fus%2Fen%2Fdeveloper%2Farticles%2Ftechnical%2Faccelerate-gguf-models-with-transformers.html&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
<li id="cite_note-gguf.md-32"><span class="mw-cite-backlink"><b><a href="#cite_ref-gguf.md_32-0">^</a></b></span> <span class="reference-text"><cite class="citation web cs1"><a rel="nofollow" class="external text" href="https://github.com/ggml-org/ggml/blob/master/docs/gguf.md">"GGUF specification (ggml/docs/gguf.md at master · ggml-org/ggml)"</a>.</cite><span title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rft.genre=unknown&amp;rft.btitle=GGUF+specification+%28ggml%2Fdocs%2Fgguf.md+at+master+%C2%B7+ggml-org%2Fggml%29&amp;rft_id=https%3A%2F%2Fgithub.com%2Fggml-org%2Fggml%2Fblob%2Fmaster%2Fdocs%2Fgguf.md&amp;rfr_id=info%3Asid%2Fen.wikipedia.org%3ALlama.cpp" class="Z3988"></span></span>
</li>
</ol></div></div></div><!--htdig_noindex--><div><div class="zim-footer">
    This article is issued from <a class="external text" title="Last edited on 2026-02-06" href="https://en.wikipedia.org/wiki/?title=Llama.cpp&amp;oldid=1336994716">Wikipedia</a>. The text is available under <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.en">Creative Commons Attribution-Share Alike 4.0</a> unless otherwise noted. Additional terms may apply for the media files.
</div>
</div><!--/htdig_noindex--></div>
            </div>
          </main>
        </div>
      </div>
    </div>
     <script src="./_webp_/webpHandler.js"></script>
  

</body></html>