Muse Spark 1.1

Hoje, temos o prazer de apresentar o Muse Spark 1.1, o modelo mais recente da Meta Superintelligence Labs e uma atualização significativa do Muse Spark. O Muse Spark 1.1 é um modelo de raciocínio multimodal desenvolvido para tarefas com agentes, com grandes avanços no uso de ferramentas e computadores, na programação e na compreensão multimodal.
Com essas melhorias, o Muse Spark 1.1 eleva o padrão de desempenho e eficiência. Juntamente com o lançamento do Muse Image nesta semana , esta versão nos aproxima da nossa visão de superinteligência pessoal: modelos que ajudam você a perseguir seus objetivos, criar o que imagina, aprofundar seus relacionamentos e agir de acordo com o que você mais valoriza.
Juntamente com este lançamento, estamos disponibilizando uma prévia pública da nova API Meta Model, onde os desenvolvedores podem acessar o Muse Spark 1.1. O modelo já está disponível no modo “Pensando” no aplicativo Meta AI e em meta.ai.
Avaliações
Para obter mais detalhes sobre nossas avaliações, consulte nosso relatório .
Agentes
O Muse Spark 1.1 oferece desempenho excepcional em tarefas de agentes pessoais que exigem planejamento e orquestração em uma variedade de aplicativos e serviços externos. Ele se generaliza instantaneamente para novas ferramentas nativas, servidores MCP e habilidades personalizadas.
O Muse Spark 1.1 consegue gerenciar ativamente sua janela de contexto de 1 milhão de tokens. Ele memoriza ações, recupera informações de trabalhos muito anteriores e as compacta de forma a preservar as etapas críticas necessárias para trabalhos posteriores.
Uso do computador
O Muse Spark 1.1 se destaca em fluxos de trabalho que envolvem múltiplos aplicativos e informações que mudam instantaneamente. Ele mantém o contexto em sessões prolongadas, adapta-se a requisitos em constante evolução e navega por interfaces desconhecidas com mínima intervenção humana.
Em vez de analisar cada etapa do processo na área de trabalho com um clique por vez, o Muse Spark 1.1 entende quando automatizar e quando usar a interface diretamente. Treinamos o modelo para escrever scripts quando a automação é mais rápida, clicar quando a interação direta é mais simples e gerar lotes de ações em cada etapa.
Organização autônoma de jantares: Em situações reais, novos contextos surgem e alteram a tarefa. O Muse Spark 1.1 percebe essas mudanças ao fazer o pedido do jantar e realiza as atualizações necessárias sem intervenção do usuário.
Codificação
O desempenho de codificação do Muse Spark 1.1 melhorou substancialmente em tarefas do mundo real envolvendo bases de código grandes e complexas. Ele consegue diagnosticar e corrigir bugs complexos, implementar novos recursos em sistemas de nível empresarial e executar grandes migrações de código. Em casos de uso como a criação de aplicativos web e sistemas de perguntas e respostas de ponta a ponta, o Muse Spark 1.1 apresenta ganhos significativos em relação ao nosso primeiro modelo.
Treinamos nosso modelo para se adaptar suavemente a diversos sistemas de controle e lidar de forma confiável com dinâmicas complexas de múltiplas voltas. O Muse Spark 1.1 apresenta bom desempenho com configurações populares de programação agentiva, suportando recursos comuns como modo de planejamento, condicionamento de objetivos, delegação de subagentes e compactação de contexto.
Demonstração de depuração no OpenCode: o Muse Spark 1.1 cria um aplicativo web de chat, captura screenshots automaticamente para identificar falhas visíveis ao usuário, rastreia os problemas até o código relevante para implementar correções e valida essas alterações. O modelo combina perfeitamente codificação, compreensão multimodal e chamada de ferramentas.
Em toda a Meta, desenvolvedores e pesquisadores usam o Muse Spark 1.1 diariamente para criar softwares mais rapidamente e trabalhar de forma mais inteligente. Em nossa principal avaliação interna de codificação, o Meta Internal Coding Bench, o Muse Spark 1.1 apresenta melhorias significativas em relação ao Muse Spark original e se mostra competitivo com as principais alternativas.
Os pesquisadores agora também estão automatizando tarefas de desenvolvimento e avaliação de modelos, aproveitando o Muse Spark 1.1 em seus fluxos de trabalho.
Avaliação do DeepSWE no OpenCode: O Muse Spark 1.1 se autoavalia em um subconjunto de tarefas do DeepSWE em diferentes níveis de raciocínio e gera um painel de análise com base nos resultados.
Multimodal
Além das capacidades de codificação e interação com agentes, o Muse Spark 1.1 se destaca na percepção, no raciocínio multimodal e no uso de ferramentas. Ele pode interagir com ambientes reais e produzir resultados concretos, com pontos fortes na geração de artefatos visuais para código, legendagem ultradescritiva de imagens e vídeos e execução de fluxos de trabalho interativos para casos de uso multimodais.
As capacidades multimodais do Muse Spark 1.1 são especialmente valiosas quando a percepção e a ação precisam ocorrer simultaneamente. O modelo pode inspecionar elementos visuais e de áudio, preservar detalhes ao longo de um fluxo de trabalho extenso e usar esses detalhes enquanto opera computadores em nome do usuário.
Agente do Facebook Marketplace: Utilizando vídeos gravados com um smartphone, o Muse Spark 1.1 extrai fotos e informações úteis sobre o produto para operar o navegador do usuário e criar um anúncio no Facebook Marketplace em nome dele.
Segurança
Realizamos extensas avaliações de segurança antes da implementação, seguindo a Estrutura Avançada de Escalonamento de IA , que define avaliações, modelos de ameaças e limites de implementação para nossos modelos mais avançados.
Em todas as categorias de risco de fronteira — Químico e Biológico, Segurança Cibernética e Perda de Controle — nossas avaliações mostram que o Muse Spark 1.1 opera dentro de margens de segurança. O Muse Spark 1.1 demonstra forte resistência a desbloqueios diretos e ataques indiretos provenientes de dados não confiáveis, injeção de código e ataques iniciados por desenvolvedores. Consequentemente, apresenta maior robustez contra adversários, menores taxas de alucinações e menor vulnerabilidade a ataques.
Nossa postura completa em relação à segurança para a versão 1.1 está documentada em nosso Relatório de Avaliação do Muse Spark 1.1 .
Disponibilidade
Pela primeira vez, os desenvolvedores podem começar a criar com o Muse Spark 1.1 por meio da nova API Meta Model, agora em versão prévia pública. Os primeiros parceiros do Muse Spark 1.1 elogiam o modelo como uma base completa para agentes, combinando o gerenciamento de contexto extenso com recursos robustos de codificação e raciocínio para lidar com cargas de trabalho de agentes em larga escala.
“O que mais impressiona no Muse Spark é a quantidade de recursos que ele oferece em um único modelo: um contexto massivo com milhões de tokens, suporte multimodal completo (imagens, vídeos, PDFs), busca integrada com citações, raciocínio robusto, recursos de codificação de alto nível (principalmente para front-end e design), saída estruturada e chamada paralela de ferramentas — tudo isso em um pacote limpo e compatível com OpenAI. Uma base completa para agentes.”
– Amjad Masad, CEO da Replit
“A Meta está claramente sendo desenvolvida para programação gênica séria – um uso robusto de ferramentas a um preço que torna viável a execução de cargas de trabalho de programação reais em grande escala. Essa combinação é rara, e é exatamente por isso que queríamos que os desenvolvedores da Cline tivessem acesso antecipado.”
— Saoud Rizwan, CEO da Cline
“Quando testado com o conjunto de avaliação de trabalho empresarial da Box, o Muse Spark apresentou recursos empresariais competitivos com os principais modelos de ponta da atualidade. Esse nível de inteligência, combinado com seus pontos fortes em fluxos de trabalho estruturados e procedimentais em setores como serviços profissionais, setor público e operações industriais, o torna uma escolha atraente para as organizações.”
– Yashodha Bhavnani, vice-presidente de produtos de IA da Box
“O Muse Spark 1.1 é um modelo incrível para executar agentes. Rápido, poderoso e divertido com o OpenClaw.”
— Dave Morin, Fundação OpenClaw
Deixe um comentário