LLVM 24.0.0git
NVPTXTargetMachine.cpp
Go to the documentation of this file.
1//===-- NVPTXTargetMachine.cpp - Define TargetMachine for NVPTX -----------===//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9// Top-level implementation for the NVPTX target.
10//
11//===----------------------------------------------------------------------===//
12
13#include "NVPTXTargetMachine.h"
14#include "NVPTX.h"
15#include "NVPTXAliasAnalysis.h"
21#include "llvm/CodeGen/Passes.h"
23#include "llvm/IR/IntrinsicsNVPTX.h"
25#include "llvm/Pass.h"
35#include <cassert>
36#include <optional>
37#include <string>
38
39using namespace llvm;
40
41// LSV is still relatively new; this switch lets us turn it off in case we
42// encounter (or suspect) a bug.
44 DisableLoadStoreVectorizer("disable-nvptx-load-store-vectorizer",
45 cl::desc("Disable load/store vectorizer"),
46 cl::init(false), cl::Hidden);
47
48// NVPTX IR Peephole is a new pass; this option will lets us turn it off in case
49// we encounter some issues.
50cl::opt<bool> DisableNVPTXIRPeephole("disable-nvptx-ir-peephole",
51 cl::desc("Disable NVPTX IR Peephole"),
52 cl::init(false), cl::Hidden);
53
54// TODO: Remove this flag when we are confident with no regressions.
56 "disable-nvptx-require-structured-cfg",
57 cl::desc("Transitional flag to turn off NVPTX's requirement on preserving "
58 "structured CFG. The requirement should be disabled only when "
59 "unexpected regressions happen."),
60 cl::init(false), cl::Hidden);
61
63 // Register the target.
66
68 // FIXME: This pass is really intended to be invoked during IR optimization,
69 // but it's very NVPTX-specific.
94}
95
97 StringRef CPU, StringRef FS,
99 std::optional<Reloc::Model> RM,
100 std::optional<CodeModel::Model> CM,
101 CodeGenOptLevel OL, bool JIT)
102 // The pic relocation model is used regardless of what the client has
103 // specified, as it is the only relocation model currently supported.
104 : CodeGenTargetMachineImpl(T, TT, CPU, FS, Options, Reloc::PIC_,
105 getEffectiveCodeModel(CM, CodeModel::Small), OL),
106 TLOF(std::make_unique<NVPTXTargetObjectFile>()),
107 Subtarget(TT, CPU, FS, *this) {
110 // NVPTX does not produce verifier-clean MIR yet; see isMachineVerifierClean()
111 // for the legacy pass manager equivalent.
113 initAsmInfo();
114}
115
117
118namespace {
119
120/// NVPTXPassConfig mirrors the NewPM implementation in NVPTXCodeGenPassBuilder
121/// in NVPTXCodeGenPassBuilder.cpp; the two must be kept in sync until this path
122/// is removed.
123class NVPTXPassConfig : public TargetPassConfig {
124public:
125 NVPTXPassConfig(NVPTXTargetMachine &TM, PassManagerBase &PM)
126 : TargetPassConfig(TM, PM) {}
127
128 NVPTXTargetMachine &getNVPTXTargetMachine() const {
130 }
131
132 void addIRPasses() override;
133 bool addInstSelector() override;
134 void addPreRegAlloc() override;
135 void addPostRegAlloc() override;
136
137 FunctionPass *createTargetRegisterAllocator(bool) override;
138 void addFastRegAlloc() override;
139 void addOptimizedRegAlloc() override;
140
141 bool addRegAssignAndRewriteFast() override {
142 llvm_unreachable("should not be used");
143 }
144
145 bool addRegAssignAndRewriteOptimized() override {
146 llvm_unreachable("should not be used");
147 }
148
149private:
150 // If the opt level is aggressive, add GVN; otherwise, add EarlyCSE. This
151 // function is only called in opt mode.
152 void addEarlyCSEOrGVNPass();
153
154 // Add passes that propagate special memory spaces.
155 void addAddressSpaceInferencePasses();
156
157 // Add passes that perform straight-line scalar optimizations.
158 void addStraightLineScalarOptimizationPasses();
159};
160
161} // end anonymous namespace
162
164 return new NVPTXPassConfig(*this, PM);
165}
166
173
177
180 return TargetTransformInfo(std::make_unique<NVPTXTTIImpl>(this, F));
181}
182
183std::pair<const Value *, unsigned>
185 if (auto *II = dyn_cast<IntrinsicInst>(V)) {
186 switch (II->getIntrinsicID()) {
187 case Intrinsic::nvvm_isspacep_const:
188 return std::make_pair(II->getArgOperand(0), llvm::ADDRESS_SPACE_CONST);
189 case Intrinsic::nvvm_isspacep_global:
190 return std::make_pair(II->getArgOperand(0), llvm::ADDRESS_SPACE_GLOBAL);
191 case Intrinsic::nvvm_isspacep_local:
192 return std::make_pair(II->getArgOperand(0), llvm::ADDRESS_SPACE_LOCAL);
193 case Intrinsic::nvvm_isspacep_shared:
194 return std::make_pair(II->getArgOperand(0), llvm::ADDRESS_SPACE_SHARED);
195 case Intrinsic::nvvm_isspacep_shared_cluster:
196 return std::make_pair(II->getArgOperand(0),
198 default:
199 break;
200 }
201 }
202 return std::make_pair(nullptr, -1);
203}
204
205void NVPTXPassConfig::addEarlyCSEOrGVNPass() {
206 if (getOptLevel() == CodeGenOptLevel::Aggressive)
207 // Disable scalar PRE due to Register Pressure increase
208 addPass(createGVNPass(/*ScalarPRE=*/false));
209 else
210 addPass(createEarlyCSEPass());
211}
212
213void NVPTXPassConfig::addAddressSpaceInferencePasses() {
214 // NVPTXLowerArgs emits alloca for byval parameters which can often
215 // be eliminated by SROA.
216 addPass(createSROAPass(/*PreserveCFG=*/true,
217 /*AggregateToVector=*/true));
219 // TODO: Consider running InferAddressSpaces during opt, earlier in the
220 // compilation flow.
223}
224
225void NVPTXPassConfig::addStraightLineScalarOptimizationPasses() {
228 // ReassociateGEPs exposes more opportunites for SLSR. See
229 // the example in reassociate-geps-and-slsr.ll.
231 // SeparateConstOffsetFromGEP and SLSR creates common expressions which GVN or
232 // EarlyCSE can reuse. GVN generates significantly better code than EarlyCSE
233 // for some of our benchmarks.
234 addEarlyCSEOrGVNPass();
235 // Run NaryReassociate after EarlyCSE/GVN to be more effective.
236 addPass(createNaryReassociatePass());
237 // NaryReassociate on GEPs creates redundant common expressions, so run
238 // EarlyCSE after it.
239 addPass(createEarlyCSEPass());
240}
241
242void NVPTXPassConfig::addIRPasses() {
243 // The following passes are known to not play well with virtual regs hanging
244 // around after register allocation (which in our case, is *all* registers).
245 // We explicitly disable them here. We do, however, need some functionality
246 // of the PrologEpilogCodeInserter pass, so we emulate that behavior in the
247 // NVPTXPrologEpilog pass (see NVPTXPrologEpilogPass.cpp).
248 disablePass(&PrologEpilogCodeInserterID);
249 disablePass(&MachineLateInstrsCleanupID);
250 disablePass(&MachineCopyPropagationID);
251 disablePass(&TailDuplicateLegacyID);
252 disablePass(&StackMapLivenessID);
253 disablePass(&PostRAMachineSinkingID);
254 disablePass(&PostRASchedulerID);
255 disablePass(&FuncletLayoutID);
256 disablePass(&PatchableFunctionID);
257 disablePass(&ShrinkWrapID);
258 disablePass(&RemoveLoadsIntoFakeUsesID);
259
260 addPass(createNVPTXAAWrapperPass());
262
263 // NVVMReflectPass is added in addEarlyAsPossiblePasses, so hopefully running
264 // it here does nothing. But since we need it for correctness when lowering
265 // to NVPTX, run it here too, in case whoever built our pass pipeline didn't
266 // call addEarlyAsPossiblePasses.
268 addPass(createNVVMReflectPass(ST.getSmVersion()));
269
270 if (getOptLevel() != CodeGenOptLevel::None)
274
275 // Lower variadic calls before address space inference.
277
278 // NVPTXLowerArgs is required for correctness and should be run right
279 // before the address space inference passes.
280 if (getNVPTXTargetMachine().getDrvInterface() == NVPTX::CUDA)
283 addPass(createNVPTXLowerArgsPass());
284 if (getOptLevel() != CodeGenOptLevel::None) {
285 addAddressSpaceInferencePasses();
286 addStraightLineScalarOptimizationPasses();
287 } else {
288 // Required for correct stack lowering
290 }
291
294
295 // === LSR and other generic IR passes ===
297 // EarlyCSE is not always strong enough to clean up what LSR produces. For
298 // example, GVN can combine
299 //
300 // %0 = add %a, %b
301 // %1 = add %b, %a
302 //
303 // and
304 //
305 // %0 = shl nsw %a, 2
306 // %1 = shl %a, 2
307 //
308 // but EarlyCSE can do neither of them.
309 if (getOptLevel() != CodeGenOptLevel::None) {
310 addEarlyCSEOrGVNPass();
313 addPass(createSROAPass(/*PreserveCFG=*/true,
314 /*AggregateToVector=*/true));
317 addPass(createNVPTXIRPeepholePass());
318 }
319
320 if (ST.hasPTXASUnreachableBug()) {
321 // Run LowerUnreachable to WAR a ptxas bug. See the commit description of
322 // 1ee4d880e8760256c606fe55b7af85a4f70d006d for more details.
323 const auto &Options = getNVPTXTargetMachine().Options;
324 addPass(createNVPTXLowerUnreachableLegacyPass(Options.TrapUnreachable,
325 Options.NoTrapAfterNoreturn));
326 }
327}
328
329bool NVPTXPassConfig::addInstSelector() {
332 addPass(createNVPTXISelDag(getNVPTXTargetMachine(), getOptLevel()));
334
335 return false;
336}
337
338void NVPTXPassConfig::addPreRegAlloc() {
340 if (getOptLevel() != CodeGenOptLevel::None)
342 // Remove Proxy Register pseudo instructions used to keep `callseq_end` alive.
344}
345
346void NVPTXPassConfig::addPostRegAlloc() {
348 if (getOptLevel() != CodeGenOptLevel::None) {
349 // NVPTXPrologEpilogPass calculates frame object offset and replace frame
350 // index with VRFrame register. NVPTXPeephole need to be run after that and
351 // will replace VRFrame with VRFrameLocal when possible.
353 }
354}
355
356FunctionPass *NVPTXPassConfig::createTargetRegisterAllocator(bool) {
357 return nullptr; // No reg alloc
358}
359
360void NVPTXPassConfig::addFastRegAlloc() {
361 addPass(&PHIEliminationID);
363}
364
365void NVPTXPassConfig::addOptimizedRegAlloc() {
366 addPass(&ProcessImplicitDefsID);
367 addPass(&LiveVariablesID);
368 addPass(&MachineLoopInfoID);
369 addPass(&PHIEliminationID);
370
372 addPass(&RegisterCoalescerID);
373
374 // PreRA instruction scheduling.
375 if (addPass(&MachineSchedulerID))
376 printAndVerify("After Machine Scheduling");
377
378 addPass(&StackSlotColoringID);
379
380 // FIXME: Needs physical registers
381 // addPass(&MachineLICMID);
382
383 printAndVerify("After StackSlotColoring");
384}
#define X(NUM, ENUM, NAME)
Definition ELF.h:857
#define LLVM_ABI
Definition Compiler.h:215
#define LLVM_EXTERNAL_VISIBILITY
Definition Compiler.h:132
This file provides the interface for LLVM's Global Value Numbering pass which eliminates fully redund...
static LVOptions Options
Definition LVOptions.cpp:25
#define F(x, y, z)
Definition MD5.cpp:54
#define T
This is the NVPTX address space based alias analysis pass.
cl::opt< bool > DisableNVPTXIRPeephole
cl::opt< bool > DisableLoadStoreVectorizer
cl::opt< bool > DisableLoadStoreVectorizer("disable-nvptx-load-store-vectorizer", cl::desc("Disable load/store vectorizer"), cl::init(false), cl::Hidden)
static cl::opt< bool > DisableRequireStructuredCFG("disable-nvptx-require-structured-cfg", cl::desc("Transitional flag to turn off NVPTX's requirement on preserving " "structured CFG. The requirement should be disabled only when " "unexpected regressions happen."), cl::init(false), cl::Hidden)
cl::opt< bool > DisableNVPTXIRPeephole("disable-nvptx-ir-peephole", cl::desc("Disable NVPTX IR Peephole"), cl::init(false), cl::Hidden)
LLVM_ABI LLVM_EXTERNAL_VISIBILITY void LLVMInitializeNVPTXTarget()
This file a TargetTransformInfoImplBase conforming object specific to the NVPTX target machine.
uint64_t IntrinsicInst * II
const GCNTargetMachine & getTM(const GCNSubtarget *STI)
static TableGen::Emitter::Opt Y("gen-skeleton-entry", EmitSkeleton, "Generate example skeleton entry")
Target-Independent Code Generator Pass Configuration Options pass.
This pass exposes codegen information to IR-level passes.
A manager for alias analyses.
void registerFunctionAnalysis()
Register a specific AA result.
CodeGenTargetMachineImpl(const Target &T, const Triple &TT, StringRef CPU, StringRef FS, const TargetOptions &Options, Reloc::Model RM, CodeModel::Model CM, CodeGenOptLevel OL)
FunctionPass class - This class is used to implement most global optimizations.
Definition Pass.h:314
const TargetSubtargetInfo * getSubtargetImpl(const Function &) const override
Virtual method implemented by subclasses that returns a reference to that target's TargetSubtargetInf...
Analysis pass providing a never-invalidated alias analysis result.
NVPTXTargetMachine(const Target &T, const Triple &TT, StringRef CPU, StringRef FS, const TargetOptions &Options, std::optional< Reloc::Model > RM, std::optional< CodeModel::Model > CM, CodeGenOptLevel OL, bool JIT)
TargetTransformInfo getTargetTransformInfo(const Function &F) const override
Get a TargetTransformInfo implementation for the target.
std::pair< const Value *, unsigned > getPredicatedAddrSpace(const Value *V) const override
If the specified predicate checks whether a generic pointer falls within a specified address space,...
void registerEarlyDefaultAliasAnalyses(AAManager &AAM) override
Allow the target to register early alias analyses (AA before BasicAA) with the AAManager for use with...
~NVPTXTargetMachine() override
MachineFunctionInfo * createMachineFunctionInfo(BumpPtrAllocator &Allocator, const Function &F, const TargetSubtargetInfo *STI) const override
Create the target's instance of MachineFunctionInfo.
TargetPassConfig * createPassConfig(PassManagerBase &PM) override
Create a pass configuration object to be used by addPassToEmitX methods for generating a pipeline of ...
PassRegistry - This class manages the registration and intitialization of the pass subsystem as appli...
static LLVM_ABI PassRegistry * getPassRegistry()
getPassRegistry - Access the global registry object, which is automatically initialized at applicatio...
Represent a constant reference to a string, i.e.
Definition StringRef.h:56
void setRequiresStructuredCFG(bool Value)
std::unique_ptr< const MCSubtargetInfo > STI
TargetOptions Options
void setEnableDefaultMachineVerifier(bool Enable)
Target-Independent Code Generator Pass Configuration Options.
virtual void addIRPasses()
Add common target configurable passes that perform LLVM IR to IR transforms following machine indepen...
TargetSubtargetInfo - Generic base class for all target subtargets.
This pass provides access to the codegen interfaces that are needed for IR-level transformations.
Target - Wrapper for Target specific information.
Triple - Helper class for working with autoconf configuration names.
Definition Triple.h:48
LLVM Value Representation.
Definition Value.h:75
PassManagerBase - An abstract interface to allow code to add passes to a pass manager without having ...
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
initializer< Ty > init(const Ty &Val)
This is an optimization pass for GlobalISel generic memory operations.
FunctionPass * createNVPTXLowerUnreachableLegacyPass(bool TrapUnreachable, bool NoTrapAfterNoreturn)
FunctionPass * createNVPTXIRPeepholePass()
FunctionPass * createNVPTXAtomicLowerLegacyPass()
FunctionPass * createNVPTXImageOptimizerLegacyPass()
void initializeNVPTXLowerUnreachableLegacyPassPass(PassRegistry &)
LLVM_ABI char & RegisterCoalescerID
RegisterCoalescer - This pass merges live ranges to eliminate copies.
decltype(auto) dyn_cast(const From &Val)
dyn_cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:643
ModulePass * createGenericToNVVMLegacyPass()
void initializeNVPTXExternalAAWrapperPass(PassRegistry &)
void initializeNVPTXPeepholeLegacyPassPass(PassRegistry &)
void initializeNVPTXPrologEpilogLegacyPassPass(PassRegistry &)
LLVM_ABI char & TailDuplicateLegacyID
TailDuplicate - Duplicate blocks with unconditional branches into tails of their predecessors.
LLVM_ABI Pass * createLoadStoreVectorizerPass()
Create a legacy pass manager instance of the LoadStoreVectorizer pass.
LLVM_ABI FunctionPass * createNaryReassociatePass()
LLVM_ABI char & PatchableFunctionID
This pass implements the "patchable-function" attribute.
ImmutablePass * createNVPTXExternalAAWrapperPass()
void initializeNVPTXLowerArgsLegacyPassPass(PassRegistry &)
LLVM_ABI char & PostRASchedulerID
PostRAScheduler - This pass performs post register allocation scheduling.
LLVM_ABI char & RemoveLoadsIntoFakeUsesID
RemoveLoadsIntoFakeUses pass.
MachineFunctionPass * createNVPTXReplaceImageHandlesLegacyPass()
void initializeNVPTXForwardParamsLegacyPassPass(PassRegistry &)
FunctionPass * createNVPTXLowerAggrCopiesLegacyPass()
ModulePass * createNVPTXAssignValidGlobalNamesLegacyPass()
LLVM_ABI char & MachineSchedulerID
MachineScheduler - This pass schedules machine instructions.
void initializeNVPTXAssignValidGlobalNamesLegacyPassPass(PassRegistry &)
FunctionPass * createNVPTXISelDag(NVPTXTargetMachine &TM, llvm::CodeGenOptLevel OptLevel)
createNVPTXISelDag - This pass converts a legalized DAG into a NVPTX-specific DAG,...
LLVM_ABI char & PrologEpilogCodeInserterID
PrologEpilogCodeInserter - This pass inserts prolog and epilog code, and eliminates abstract frame re...
MachineFunctionPass * createNVPTXAddressFolderLegacyPass()
void initializeNVPTXLowerAllocaLegacyPassPass(PassRegistry &)
void initializeGenericToNVVMLegacyPassPass(PassRegistry &)
void initializeNVPTXCtorDtorLoweringLegacyPass(PassRegistry &)
MachineFunctionPass * createNVPTXForwardParamsLegacyPass()
FunctionPass * createNVPTXTagInvariantLoadsPass()
LLVM_ABI char & MachineLoopInfoID
MachineLoopInfo - This pass is a loop analysis pass.
void initializeNVVMReflectLegacyPassPass(PassRegistry &)
void initializeNVPTXAddressFolderLegacyPassPass(PassRegistry &)
CodeModel::Model getEffectiveCodeModel(std::optional< CodeModel::Model > CM, CodeModel::Model Default)
Helper method for getting the code model, returning Default if CM does not have a value.
LLVM_ABI ModulePass * createExpandVariadicsPass(ExpandVariadicsMode)
LLVM_ABI char & ShrinkWrapID
ShrinkWrap pass. Look for the best place to insert save and restore.
LLVM_ABI char & MachineLateInstrsCleanupID
MachineLateInstrsCleanup - This pass removes redundant identical instructions after register allocati...
void initializeNVPTXAAWrapperPassPass(PassRegistry &)
void initializeNVPTXIRPeepholePass(PassRegistry &)
ModulePass * createNVPTXLowerArgsPass()
LLVM_ABI FunctionPass * createSpeculativeExecutionPass()
LLVM_ABI char & StackMapLivenessID
StackMapLiveness - This pass analyses the register live-out set of stackmap/patchpoint intrinsics and...
FunctionPass * createNVPTXMarkKernelPtrsGlobalPass()
LLVM_ABI char & FuncletLayoutID
This pass lays out funclets contiguously.
void initializeNVVMIntrRangePass(PassRegistry &)
MachineFunctionPass * createNVPTXPrologEpilogLegacyPass()
LLVM_ABI char & PostRAMachineSinkingID
This pass perform post-ra machine sink for COPY instructions.
CodeGenOptLevel
Code generation optimization level.
Definition CodeGen.h:227
void initializeNVPTXLowerAggrCopiesLegacyPassPass(PassRegistry &)
LLVM_ABI char & StackSlotColoringID
StackSlotColoring - This pass performs stack slot coloring.
ModulePass * createNVPTXPromoteParamAlignPass()
void initializeNVPTXAsmPrinterPass(PassRegistry &)
LLVM_ABI FunctionPass * createSeparateConstOffsetFromGEPPass(bool LowerGEP=false)
void initializeNVPTXProxyRegErasureLegacyPassPass(PassRegistry &)
LLVM_ABI char & ProcessImplicitDefsID
ProcessImpicitDefs pass - This pass removes IMPLICIT_DEFs.
void initializeNVPTXTagInvariantLoadLegacyPassPass(PassRegistry &)
void initializeNVPTXAtomicLowerLegacyPassPass(PassRegistry &)
MachineFunctionPass * createNVPTXPeepholeLegacyPass()
LLVM_ABI FunctionPass * createGVNPass()
Definition GVN.cpp:4093
FunctionPass * createNVPTXLowerAllocaLegacyPass()
ModulePass * createNVPTXCtorDtorLoweringLegacyPass()
void initializeNVPTXMarkKernelPtrsGlobalLegacyPassPass(PassRegistry &)
LLVM_ABI char & LiveVariablesID
LiveVariables pass - This pass computes the set of blocks in which each variable is life and sets mac...
LLVM_ABI FunctionPass * createSROAPass(bool PreserveCFG=true, bool AggregateToVector=false)
Definition SROA.cpp:6437
Target & getTheNVPTXTarget64()
LLVM_ABI FunctionPass * createInferAddressSpacesPass(unsigned AddressSpace=~0u)
void initializeNVPTXAllocaHoistingLegacyPassPass(PassRegistry &)
ImmutablePass * createNVPTXAAWrapperPass()
FunctionPass * createNVPTXAllocaHoistingLegacyPass()
ModulePass * createNVVMReflectPass(unsigned int SmVersion)
LLVM_ABI char & TwoAddressInstructionPassID
TwoAddressInstruction - This pass reduces two-address instructions to use two operands.
void initializeNVPTXPromoteParamAlignLegacyPassPass(PassRegistry &)
LLVM_ABI FunctionPass * createAtomicExpandLegacyPass()
AtomicExpandPass - At IR level this pass replace atomic instructions with __atomic_* library calls,...
LLVM_ABI FunctionPass * createStraightLineStrengthReducePass()
BumpPtrAllocatorImpl<> BumpPtrAllocator
The standard BumpPtrAllocator which just uses the default template parameters.
Definition Allocator.h:390
LLVM_ABI FunctionPass * createEarlyCSEPass(bool UseMemorySSA=false)
LLVM_ABI char & PHIEliminationID
PHIElimination - This pass eliminates machine instruction PHI nodes by inserting copy instructions.
MachineFunctionPass * createNVPTXProxyRegErasureLegacyPass()
LLVM_ABI char & MachineCopyPropagationID
MachineCopyPropagation - This pass performs copy propagation on machine instructions.
Target & getTheNVPTXTarget32()
void initializeNVPTXDAGToDAGISelLegacyPass(PassRegistry &)
Implement std::hash so that hash_code can be used in STL containers.
Definition BitVector.h:878
MachineFunctionInfo - This class can be derived from and used by targets to hold private target-speci...
static FuncInfoTy * create(BumpPtrAllocator &Allocator, const Function &F, const SubtargetTy *STI)
Factory function: default behavior is to call new using the supplied allocator.
RegisterTargetMachine - Helper template for registering a target machine implementation,...