Что такое сетевые технологии на основе искусственного интеллекта?
Сетевая инфраструктура для ИИ — это высокопроизводительная сетевая инфраструктура, необходимая для поддержки крупномасштабных задач искусственного интеллекта и машинного обучения. В отличие от традиционных корпоративных приложений, задачи ИИ требуют значительных сетевых ресурсов, поскольку зависят от огромных объемов данных, непрерывно перемещающихся между вычислительными ресурсами, хранилищами и ускорителями.
Современные среды обучения ИИ генерируют значительные результаты. движение с востока на запад—Вместо типичного для традиционных приложений трафика «север-юг» используется обмен данными между серверами внутри центра обработки данных. Во время распределенного обучения тысячи графических процессоров часто обмениваются параметрами модели, градиентами и промежуточными данными для поддержания синхронизации, что обеспечивает эффективную работу. кластерная сеть графических процессоров необходимо для обеспечения производительности в масштабе.
По мере роста кластеров ИИ от десятков до тысяч ускорителей, производительность сети становится критически важной. Высокопроизводительная коммутация на базе коммерческие кремниевые ИИ-переключатели, включая Платформы Ethernet 400G и 800G, Это помогает уменьшить узкие места и поддерживать пропускную способность для крупномасштабных задач искусственного интеллекта.

Этот процесс в значительной степени зависит от быстрой синхронизации графических процессоров и операций коллективной связи, таких как all-reduce. Даже небольшие задержки, перегрузки или потери пакетов могут привести к простою дорогостоящих графических процессоров, замедляя обучение модели и снижая эффективность инфраструктуры.
Для удовлетворения этих требований современные сети искусственного интеллекта используют сети с низкой задержкой и высокой пропускной способностью, разработанные для максимального использования графических процессоров и эффективной передачи данных внутри кластера. Вспомогательные ресурсы, такие как Информационный документ по искусственному интеллекту и машинному обучению, Edgecore Open Fabric, и Broadcom Tomahawk 6 предоставить более глубокий технический контекст для крупномасштабного проектирования тканей с использованием искусственного интеллекта.
Почему рабочие нагрузки ИИ разрушают традиционные сети центров обработки данных
Рабочие нагрузки ИИ предъявляют принципиально иные требования к сетевой инфраструктуре, чем традиционные корпоративные приложения. По мере масштабирования кластеров ИИ традиционные архитектуры часто становятся узкими местами, ограничивая производительность и увеличивая время обучения.
Основная проблема связана с интенсивными схемами коллективного взаимодействия на графических процессорах, такими как... все-редукции, где большие объемы данных должны обмениваться между множеством графических процессоров во время каждой итерации обучения. Эти операции требуют чрезвычайно быстрой и предсказуемой связи для синхронизации распределенных рабочих нагрузок.
Нагрузки ИИ также генерируют короткие, но интенсивные всплески трафика, известные как микропорывы, Это может перегрузить традиционные сети Ethernet и вызвать перегрузку, потерю пакетов и повторную передачу. Даже кратковременные сбои могут остановить конвейеры обработки данных на графических процессорах и значительно снизить эффективность кластера.
Для решения этих проблем современные Сетевые решения для центров обработки данных на основе ИИ все чаще полагается на такие технологии, как RDMA (удаленный прямой доступ к памяти), Ethernet без потерь, а также масштабируемые архитектуры leaf-spine. Эти технологии помогают уменьшить узкие места, одновременно повышая пропускную способность для обучения и вывода ИИ.
Многие организации также внедряют открытые сети для ИИ через дезагрегированная инфраструктура ИИ, Разделение аппаратного и программного уровней позволяет повысить масштабируемость, гибкость и экономическую эффективность, одновременно снижая зависимость от конкретного поставщика.
Основные концепции
Изучите шесть ключевых концепций, определяющих современные сетевые технологии в сфере искусственного интеллекта — от связи между кластерами графических процессоров и сетей Ethernet для ИИ до открытой, дезагрегированной инфраструктуры.
Ethernet против InfiniBand
Дискуссия вокруг Ethernet против InfiniBand для сетей искусственного интеллекта По мере масштабирования крупных кластеров ИИ в организациях, обе технологии приобретают все большее значение. Обе технологии могут обеспечить низкую задержку и высокую пропускную способность, необходимые для современных систем. кластерная сеть графических процессоров, Однако они различаются по стоимости, гибкости и открытости экосистемы. InfiniBand долгое время считался предпочтительным решением для высокопроизводительных вычислительных сред со сверхнизкой задержкой, в то время как достижения в области Ethernet без потерь, RoCE и управления перегрузкой быстро улучшают производительность современных систем. Ethernet AI-сети. Для организаций, создающих масштабируемые решения. Сетевые решения для центров обработки данных на основе ИИ В контексте инфраструктуры решение часто сводится к поиску баланса между высокой производительностью, экономической эффективностью, простотой эксплуатации и долгосрочной гибкостью.
| Особенность | Ethernet + RoCE | InfiniBand |
|---|---|---|
| Расходы | Ниже | Выше |
| Привязка к поставщику | Низкий | Высокий |
| Экосистема | Широкий | Специализированный |
| производительность ИИ | Высокий | Очень высокий |
Для получения более подробной технической информации RoCE, PFC и ECN и общая стоимость владения, Ознакомьтесь с нашими техническими ресурсами.
Открытые сети для ИИ
По мере масштабирования инфраструктуры искусственного интеллекта многие организации переосмысливают собственные сетевые модели, основанные на тесной интеграции аппаратного и программного обеспечения. Открытые сети для ИИ Предлагает более гибкий и экономически эффективный подход за счет отделения сетевой операционной системы от базового оборудования.
В основе этого подхода лежит следующее: дезагрегация сети, Это позволяет операторам самостоятельно выбирать лучшее в своем классе оборудование и программное обеспечение. Это обеспечивает большую масштабируемость. кластерная сеть графических процессоров при этом снижая зависимость от экосистемы одного поставщика.
Сетевые технологии искусственного интеллекта Whitebox является ключевым элементом этой модели. Она построена на стандартизированном оборудовании и работает на базе... коммерческие кремниевые ИИ-переключатели, Платформы типа Whitebox обеспечивают производительность гипермасштабируемого класса без высоких затрат, характерных для проприетарных систем.
Операционные системы, такие как SONiC Обеспечивает масштабируемость и программируемость сети за счет автоматизации, телеметрии и современных API. Хорошо спроектированная система. Ткань SONiC AI помогает упростить операции, поддерживая при этом крупномасштабные задачи искусственного интеллекта.
Результат ниже. общая стоимость владения (TCO) На протяжении всего жизненного цикла сети за счет снижения затрат на оборудование, повышения операционной эффективности и минимизации зависимости от поставщика.
Традиционные и открытые сети искусственного интеллекта
| Традиционные сети искусственного интеллекта | Открытые сети искусственного интеллекта |
|---|---|
| Собственный стек | Дезагрегированный стек |
| Закрытая NOS | SONiC |
| Привязка к поставщику | Гибкость при работе с несколькими поставщиками |
| Более высокая общая стоимость владения | Снижение совокупной стоимости владения |
Именно здесь Edgecore выделяется среди конкурентов — сочетание высокопроизводительного открытого оборудования, передовых микросхем и широкой совместимости с экосистемой позволяет создать масштабируемую, эффективную и перспективную сетевую инфраструктуру для искусственного интеллекта. Узнайте больше внедрение ИИ в реальных условиях увидеть открытые платформы искусственного интеллекта в действии.
Библиотека ресурсов
Почему SONiC идеально подходит для центров обработки данных ИИ? | В статье рассматривается, как SONiC обеспечивает масштабируемые, открытые и гибкие сетевые архитектуры, оптимизированные для высокопроизводительных сред искусственного интеллекта и облачных центров обработки данных.
От строительных блоков к решениям: готовое решение открытой инфраструктуры для корпоративного ИИ В статье подробно объясняется, как модульные, открытые сетевые компоненты объединяются для создания полной, готовой к использованию инфраструктуры для развертывания ИИ в предприятиях.
Масштабное внедрение искусственного интеллекта: незаменимая роль мостов между центрами обработки данных с PFC и ECN для крупных развертываний графических процессоров В статье объясняется, как технологии PFC и ECN обеспечивают высокую производительность Ethernet без потерь, что крайне важно для крупномасштабных кластеров графических процессоров и рабочих нагрузок обучения ИИ.
Broadcom Tomahawk 6: поддержка новейшего поколения сетей искусственного интеллекта и гипермасштабируемых сетей | Рассматривается, как коммутационная архитектура Broadcom Tomahawk 6 поддерживает сети следующего поколения 400G/800G для искусственного интеллекта и гипермасштабных центров обработки данных.
Пять веских причин развернуть ИИ-приложение уже сегодня! | В статье освещаются ключевые факторы реального применения ИИ, которые ускоряют спрос на масштабируемые высокопроизводительные сетевые решения для центров обработки данных.
Информационный документ по искусственному интеллекту и машинному обучению | Рекомендации по созданию сетевой инфраструктуры для поддержки рабочих нагрузок в области искусственного интеллекта и машинного обучения.
Белая книга Edgecore Open Fabric Анализ масштабируемых сетевых архитектур для искусственного интеллекта и особенностей их развертывания.
Общая стоимость владения (TCO) Анализ эффективности, масштабируемости и оптимизации затрат инфраструктуры для современных сред искусственного интеллекта.
Создание оптимизированных для ИИ фабрик центров обработки данных: дезагрегация и высокопроизводительные сети Узнайте, как дезагрегированная инфраструктура и открытые сети позволяют создавать масштабируемые высокопроизводительные платформы искусственного интеллекта, оптимизированные для современных рабочих нагрузок на графических процессорах.
Расширяем возможности корпоративных решений с помощью сетевых коммутаторов открытого класса Edgecore и коммутаторов корпоративного класса SONiC от Broadcom. Узнайте, как Edgecore и Enterprise SONiC объединяют открытое аппаратное и программное обеспечение для создания масштабируемых, готовых к производственному использованию сетей искусственного интеллекта.
Создание идеальной инфраструктуры для ИИ: запланированный Ethernet от DriveNet. Узнайте, как функция Scheduled Ethernet улучшает управление перегрузками, снижает задержку и повышает пропускную способность крупномасштабных кластеров искусственного интеллекта.
Программируемая дезагрегированная сетевая операционная среда Узнайте, как программируемые, дезагрегированные сети обеспечивают большую автоматизацию, гибкость и контроль для современной инфраструктуры искусственного интеллекта.
600 сетей. Одна система управления сетью. Отсутствие привязки к конкретному поставщику. Узнайте, как унифицированная сетевая операционная система упрощает операции и снижает зависимость от конкретного поставщика при крупномасштабных развертываниях.
Повышение качества медицинского обслуживания с помощью решений проводных и беспроводных сетей Edgecore | Демонстрирует, как коммутаторы Edgecore и Broadcom SONiC обеспечивают масштабируемую высокопроизводительную коммутацию для современных сетей центров обработки данных.
Откройте путь инновациям с помощью поддерживаемого сообществом дистрибутива Edgecore SONiC | Демонстрирует, как дистрибутив SONiC от сообщества Edgecore обеспечивает гибкое, открытое и масштабируемое развертывание сети для современных центров обработки данных.
IPNexia обеспечивает работу дата-центра совместно с Edgecore Networks и Deca Consulting. Узнайте, как IPNexia создала высокопроизводительную масштабируемую сеть центра обработки данных, используя открытые сетевые решения Edgecore.
Сети Edgecore: новаторское иммерсионное охлаждение с Submer, центрами обработки данных Stellium и Circle B Узнайте, как иммерсионное охлаждение и открытые сети помогают поддерживать плотную, энергоэффективную инфраструктуру искусственного интеллекта в масштабе предприятия.
Сотрудничество LINX с Edgecore Networks и IP Infusion для обновления локальной сети LON2 Узнайте, как LINX модернизировала сетевую инфраструктуру, используя дезагрегированные сети для повышения масштабируемости и операционной гибкости.
Как компания Edgecore развернула глобальную программно-конфигурируемую сеть на основе протокола OpenFlow в университете NCTU В статье подчеркивается, как программно-определяемые сети обеспечили централизованное управление и большую программируемость сети в масштабе предприятия.






